TRAIL Search
← 블로그 목록AI 검색엔진은 어떤 브랜드를 언급할까? 규모·인지도·출처 벤치마크

AI 검색엔진은 어떤 브랜드를 언급할까? 규모·인지도·출처 벤치마크

10만 건 응답으로 측정한 다섯 AI 엔진의 브랜드 가시성 지도

· TRAIL Labs Research
GEOAI 가시성Share of Voice브랜드 측정AI 검색

이 논문은 102개 브랜드를 다섯 AI 검색엔진에서 10만 건 넘게 관측해, "사용자가 우리 카테고리를 물었을 때 AI가 실제로 우리를 언급하는가"를 대규모로 측정한 첫 GEO 벤치마크예요. ChatGPT·Gemini·Perplexity·Claude·Grok을 2026년 3–5월에 걸쳐 추적하며, 브랜드 가시성을 정의하고 엔진 간 차이를 숫자로 드러내요 [1]. GEO라는 문제의 정의와 지표는 GEO 원전 논문에서 다뤘으니, 여기서는 그 위에 얹힌 대규모 측정과 그 결과를 파고들어요.

파란 링크 열 개를 훑던 검색은 이제 AI에게 직접 묻는 방식으로 옮겨갔어요. 브랜드 입장에서 질문도 바뀌었어요. 예전엔 "키워드에서 몇 위인가"였다면, 지금은 "누가 우리 카테고리를 물었을 때 AI가 우리 이름을 부르는가"예요 [1][2]. 이 논문은 그 질문을 재는 자를 만들고, 102개 브랜드에 대고 실제로 재봤어요.

무엇을 측정하나: 가시성의 세 신호

이 논문에서 브랜드 가시성은 하나의 숫자가 아니라 세 신호의 묶음이에요 [1].

  • 언급 여부(mention): 응답에 브랜드가 등장하는가(Boolean).
  • 순번(position): 등장했다면 몇 번째로 불렸는가(1·2·3위).
  • 감성(sentiment): 긍정·중립·부정 중 어떤 톤으로 프레이밍됐는가.

중요한 구분이 하나 더 있어요. 브랜드 이름을 넣지 않은 unbranded 질의("best Indian fintech payment platform")에서의 노출은 진짜 발견 가능성을 재고, 이름을 넣은 branded 질의("what does Razorpay do")에서의 노출은 자기 인지도만 확인해요 [1]. 논문이 헤드라인으로 삼는 건 언제나 unbranded 가시성이에요. AI가 우리를 이미 알아서 부르는지가 성과이기 때문이에요.

각 응답에는 언급 유형 이 붙어요. 각각 첫 추천(fr)·상위 3(t3)·언급(m)·간접(i)·미언급(none)이에요 [1].

다섯 엔진을 어떻게 재나

먼저 재는 대상인 다섯 엔진의 설정부터 봐요. 검색 접지(grounding) 정책이 엔진마다 달라서, 이 차이가 뒤의 결과를 상당 부분 설명해요 [1].

엔진모델웹검색 정책
ChatGPTGPT-5브랜드별 주간 쿨다운
GeminiGemini-3항상 접지
PerplexitySonar항상 접지(검색 네이티브)
ClaudeClaude Sonnet브랜드별 주간 쿨다운
GrokGrok-3항상 검색

표 1. 다섯 엔진의 모델·웹검색 정책 [1].

가시성은 언급된 프롬프트의 비율이에요. 프롬프트 집합 에서 언급이 일어난 비율로 정의돼요 [1].

평균 순번은 언급된 프롬프트에 한해 순번의 평균으로 재요. 낮을수록 좋아요 [1].

점유율(Share of Voice)은 그 브랜드의 언급 수를 자신과 자격 있는 경쟁자들의 언급 수 합으로 나눠요. 분모의 경쟁자 집합 는 반복 등장하거나 실재하는 도메인만 넣어서, 엔진이 지어낸 환각 이름이 분모를 부풀리지 않게 해요 [1].

감성 점수는 긍정에 1, 중립에 0.5, 부정에 0을 줘서 100점 척도로 만들어요. 부정 한 번이 중립 한 번의 두 배만큼 점수를 깎아요 [1].

엔진끼리 얼마나 다른 소스를 인용하는지는 인용 도메인 집합의 Jaccard 중복으로 재요. 가 엔진 가 프롬프트 에서 인용한 도메인 집합이에요 [1].

데이터 규모는 이래요. 102개 브랜드, 3508회 완료된 추적 런, 10만2025건의 프롬프트 응답, 약 1만5815건의 브랜드 언급, 14만9912건의 소스 인용을 2026년 3–5월에 모았어요 [1]. 신뢰구간은 1만 회 부트스트랩, 계층 비교는 Kruskal–Wallis 후 Bonferroni 보정 Mann–Whitney로 잡았어요 [1].

브랜드 위상이 가시성을 지배한다

이 논문의 헤드라인은 위상 사다리예요. 브랜드를 세 티어로 나눠 첫 추적 런의 unbranded 가시성을 재면, 한 단계 내려갈 때마다 가시성이 뚝 떨어져요 [1].

티어브랜드 예unbranded 가시성95% CI다음 티어와 차이
Tier 1 ()Stripe·Nike 급72.9%[60.1, 84.2]−29.3%p
Tier 2 ()중견·지역 강자43.6%[36.4, 50.9]−32.2%p
Tier 3 ()니치·소형11.4%[4.2, 20.3]없음

표 2. 위상 티어별 첫 런 unbranded 가시성 [1].

통계도 이 사다리를 강하게 받쳐요. Kruskal–Wallis , 로 세 티어의 분포가 같다는 가설이 기각됐고, 모든 쌍 비교가 Bonferroni 보정을 통과했어요 [1]. 효과 크기 Cohen's 도 T1 대 T3에서 2.34로 거대했어요 [1]. 논문의 표현대로 "위상 사다리를 한 칸 내려갈 때마다 unbranded 가시성 약 30%p가 든다"는 뜻이에요 [1].

이게 왜 중요하냐면, 대부분의 브랜드가 Tier 3에 몰려 있고 그들은 카테고리 질의의 약 11%에서만 등장하기 때문이에요 [1]. 발견 가능성의 지배적 극단은 '보이지 않음'이에요.

엔진마다 답이 갈린다

같은 브랜드라도 엔진에 따라, 그리고 질문의 종류에 따라 노출이 크게 달라져요. 먼저 첫 런 인지율을 branded와 unbranded로 갈라 보면 이래요 [1].

엔진brandedunbranded
ChatGPT94.2%22.1%
Gemini94.0%18.7%
Perplexity98.5%23.9%
Claude100.0%51.5%
Grok100.0%12.0%

표 3. 엔진별 첫 런 인지율(branded 대 unbranded) [1].

branded 열이 90%를 넘는 건 당연해요. 이름을 넣고 물으니 알아보는 거예요. 진짜 신호는 unbranded 열이고, Claude(51.5%)를 빼면 대부분 12–24% 구간에 몰려 있어요 [1]. Claude가 높은 건 이 코호트가 높은 위상 브랜드에 치우친 표본이라는 점이 섞여 있어요 [1].

질문의 종류도 결정적이에요. 넓은 발견형 질문은 브랜드를 잘 띄우지만, 구체적인 문제·유스케이스 질문은 거의 안 띄워요 [1].

프롬프트 카테고리전체ChatGPTGeminiPerplexity
Discovery(발견)22.9%22.0%20.6%20.0%
Problem/Solution(문제해결)10.8%10.4%8.9%9.1%
Use Case(유스케이스)11.4%9.9%11.9%10.3%
Comparison(비교)74.6%73.3%72.6%73.7%
Brand Research(브랜드조사)97.0%97.9%95.7%95.7%

표 4. 프롬프트 카테고리별 unbranded 가시성(발췌) [1].

넓은 "best X" 질문에서 22.9%로 가장 잘 뜨고, 구체적 문제·유스케이스 질문에선 10.8–11.4%로 가장 안 떠요 [1]. 그리고 엔진들은 서로 다른 소스를 봐요. CRM 사례에서 플랫폼 쌍의 평균 소스 중복은 Jaccard 약 0.12로 매우 낮았어요 [1]. 한 엔진에서 통한 전술이 다른 엔진으로 잘 전이되지 않는다는 뜻이에요.

한 카테고리를 확대해 보면 순번의 급경사가 보여요. CRM 열 개 브랜드를 추적한 참조 연구에서, 언급됐을 때의 평균 순번은 이래요 [1].

브랜드ChatGPTGeminiPerplexityClaudeGrok
Salesforce1.21.31.41.82.1
HubSpot1.52.01.81.31.9
Zoho3.13.83.52.43.2
Pipedrive3.43.62.83.14.1

표 5. CRM 참조 연구의 브랜드·엔진별 평균 순번(낮을수록 좋음) [1]. 상위 세 브랜드가 전체 CRM 언급의 51%를 가져갔어요 [1].

인용의 출처는 자기 도메인이 아니다

가시성을 만드는 소스가 어디인지도 대규모로 뜯어봤어요. 14만9912건의 인용을 소스 클래스로 나누면 그림이 선명해요 [1].

소스 클래스인용 수비중
기업·제3자 브랜드 페이지112,76375.2%
유튜브·영상6,3114.2%
테크·비즈니스 미디어5,6663.8%
Reddit·커뮤니티 포럼4,9923.3%
학술·정부·소셜·개발자4,6173.1%
브랜드 자기 도메인4,3922.9%
Wikipedia·레퍼런스3,8822.6%
소프트웨어 리뷰(G2·Capterra)1,6041.1%

표 6. 소스 클래스별 인용 분포 [1].

핵심은 자기 도메인이 인용의 2.9%뿐이고, 75.2%는 같은 분야 다른 회사 페이지를 가리킨다는 거예요 [1]. 자사 페이지를 아무리 다듬어도, 인용의 대부분은 경쟁·중립 페이지에서 나와요. Algaba et al.이 관찰한 "이미 인용된 도메인이 더 인용된다"는 Matthew 효과가 브랜드 층위에서도 나타나는 셈이에요 [4]. 그래서 점유율(SoV)은 경쟁 페이지 위에서 다투는 문제가 돼요.

콘텐츠 페이지만 놓고 보면 지렛대가 분명해요. 전체 인용의 21%가 리스티클("best CRM tools" 같은 랭킹 리스트)이라, 한 개의 잘 랭크된 리스트가 여러 AI 답변에 우리를 실어 날라요 [1]. 이 관찰은 소스 측 신호를 손봐야 한다는 C-SEO Bench의 결론과도 맞물려요 [3].

언급은 안정적, 감성은 요동친다

같은 브랜드·프롬프트·엔진 셀을 여러 런 반복하면, 언급은 놀랄 만큼 결정적이에요. 3회 이상 관측한 unbranded 셀 중 63.2%는 한 번도 안 뜨고, 14.3%는 늘 떠요. 30–70% 사이에서 흔들리는 '플리핑'은 6.8%뿐이에요 [1]. 즉 77.5%가 늘·전혀 두 극단으로 갈리는 near-binary예요 [1].

감성은 정반대예요. 같은 기준에서 감성 플리핑률이 45.5%로, 언급 플리핑(6.8%)보다 약 6.7배 노이즈가 커요 [1]. 대신 늘 부정으로 굳는 셀은 0.0%였어요. 부정은 떠도 일시적이고, 엔진이 추적 브랜드를 부정적으로 고정하는 일은 사실상 없었어요 [1]. 실무적으로는 감성 점수를 안정시키려면 브랜드당 10개 이상의 프롬프트가 필요하다는 뜻이에요 [1].

내버려 두면 어떻게 될까요. 개입 없는 기준선에서 unbranded 가시성의 런당 기울기는 대체로 평평하되, ChatGPT(−1.34%/런)와 Perplexity(−0.76%/런)에서만 통계적으로 유의한 완만한 하락이 나왔어요 [1]. "아무것도 안 하면 이 두 엔진에서 가시성이 천천히 샌다"는 얘기예요 [1].

이 벤치마크의 한계

논문은 스스로 경계를 분명히 그어요 [1].

  • 인과가 아닌 관측: 추적 궤적은 전부 관측 기준선이고, 추천이 가시성을 실제로 올리는지는 RCT(Protocol P3)로 미뤘어요. Aggarwal et al.의 실험 설계를 브랜드 함대에 적용하는 게 후속 과제예요 [1][2].
  • 편의 표본 코호트: SaaS·리테일·핀테크·인도 DTC에 치우쳐서 카테고리 대표성이 없어요. Tier 1은 로 작아, leave-one-out 민감도(70.5–76.7%)로 보완했지만 완전히 해소하진 못했어요 [1].
  • 손코딩 티어 분류: 위키·언론·펀딩 신호로 사람이 티어를 매겨서 주관이 섞여요. 평가자 간 신뢰도 감사는 v1.1로 미뤘어요 [1].
  • 플랫폼 불투명성: 추론은 API 출력에서만 나와요. 엔진의 수집·검색 내부는 직접 볼 수 없어요 [1].
  • 휴리스틱 감성: 45.5% 플리핑률에 출력 분산과 분류기 노이즈가 섞여 있어요 [1].

TRAIL 관점: 멀티엔진 가시성은 추적의 문제

이 연구가 던지는 질문은 우리가 매일 다루는 문제 그 자체예요. AEO·GEO의 성과는 결국 "AI가 이 답을 만들 때 우리를 불렀나, 몇 번째로, 어떤 톤으로 불렀나"이고, TRAIL Search가 하는 일이 바로 이 멀티엔진 가시성·점유율(SoV) 추적이에요. 논문의 발견을 실무 원칙으로 옮기면 이래요.

  • 엔진별로 따로 재요: 소스 중복이 약 0.12로 낮아서 [1], 하나의 대시보드에 다섯 엔진을 합쳐 평균만 보면 진짜 격차가 지워져요. ChatGPT에서 뜨는 소스와 Perplexity에서 뜨는 소스는 다른 페이지예요.
  • 자사 페이지 너머를 봐요: 인용의 2.9%만 자기 도메인이라 [1], 경쟁·리뷰·리스티클 페이지에서의 점유율이 진짜 전장이에요. 특히 전체 인용의 21%를 차지하는 리스티클에 우리가 실려 있는지가 큰 지렛대예요 [1].
  • 위상을 알고 시작해요: Tier마다 약 30%p씩 벌어지니 [1], 소형 브랜드는 헤드-투-헤드 인지보다 경쟁자 대비 SoV를 목표로 잡는 게 현실적이에요.
  • 주기는 14–30일로: 언급은 near-binary로 안정적이지만 감성은 6.7배 요동치고 [1], 방치하면 일부 엔진에서 서서히 하락하니 [1], 분기보다 2–4주 주기로 재측정하고 개입 효과를 확인해요.

결국 이 논문은 GEO를 '느낌'에서 '측정'으로 옮겨 놓았어요. 무엇을 담을지 설계로 푸는 FeatGEO가 콘텐츠 쪽의 최적화라면, 이 연구는 그 최적화가 실제 AI 답변 속 우리 자리를 어떻게 바꾸는지 대규모로 재는 자예요. 어떤 문서가 답을 만들었는지 되짚는 RAG 출처 귀속 연구와 함께 보면, 설계와 측정이 한 쌍으로 맞물려요. 재지 않으면 고칠 수도 없으니까요.

자주 묻는 질문

이 논문이 말하는 '브랜드 가시성'이 뭔가요?

사용자가 카테고리 질문을 던졌을 때 AI가 그 브랜드를 실제로 언급·인용·추천하는지예요. 세 신호로 나눠 재요. 언급 여부(Boolean), 언급됐을 때의 순번(1·2·3위), 그리고 긍정·중립·부정 감성이에요. 브랜드 이름을 넣지 않은 unbranded 질의에서의 노출이 진짜 발견 가능성을 재는 핵심 지표예요.

엔진마다 결과가 많이 다른가요?

네. 같은 질의에도 엔진들이 인용하는 도메인이 거의 겹치지 않아요. CRM 사례에서 플랫폼 쌍의 평균 소스 중복(Jaccard)은 약 0.12로 매우 낮았어요. 프롬프트 카테고리별 가시성도 엔진마다 달라서, 하나의 플레이북으로 다섯 엔진을 다 잡는 접근은 통하지 않아요.

우리 웹사이트를 잘 만들면 인용되나요?

자사 도메인만으로는 부족해요. 전체 인용의 2.9%만 브랜드 자기 도메인을 가리켰고, 75.2%는 같은 분야 다른 회사 페이지를 가리켰어요. 대신 'best X 도구' 같은 리스티클이 전체 인용의 21%로 가장 큰 지렛대라, 한 개의 랭킹 리스트가 여러 AI 답변에 우리를 실어 나를 수 있어요.

브랜드가 작으면 방법이 없나요?

위상 사다리가 가혹하긴 해요. Tier 1이 72.9%, Tier 2가 43.6%, Tier 3가 11.4%로 한 단계마다 약 30%p씩 떨어졌어요. 다만 언급은 near-binary라 늘·전혀 두 극단으로 갈리고, 내버려 두면 ChatGPT·Perplexity에서 서서히 하락해요. 그래서 경쟁 페이지에서의 점유율(SoV)을 겨냥하고 14–30일 주기로 재측정하는 운영이 현실적이에요.

참고자료

  1. [1]Kumar, "Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines", arXiv 2026
  2. [2]Aggarwal et al., "GEO: Generative Engine Optimization", KDD 2024
  3. [3]Puerto et al., "C-SEO Bench: Does Conversational SEO Work?", NeurIPS Datasets 2025
  4. [4]Algaba et al., "How Deep Do Large Language Models Internalize Scientific Literature and Citation Practices?", 2025
  5. [5]Yang, "News Source Citing Patterns in AI Search Systems", 2025

요약

  • 이 논문은 102개 브랜드·10만2025건 응답·15만 건 인용을 다섯 AI 엔진에서 수집해 브랜드 가시성을 대규모로 측정한 첫 벤치마크예요.
  • 가시성은 언급 여부·순번·감성 세 신호로 재고, 가시성·평균순번·점유율(SoV)·감성·소스 중복을 각각의 식으로 정의해요.
  • 헤드라인은 위상 사다리예요. Tier 1·2·3의 unbranded 가시성이 72.9%·43.6%·11.4%로 한 단계마다 약 30%p씩 떨어졌어요.
  • 엔진은 서로 갈려요. 소스 중복이 약 0.12로 낮고, 인용의 2.9%만 자사 도메인이며 리스티클이 전체 인용의 21%로 지렛대가 가장 커요.
  • 언급은 near-binary로 안정적이지만 감성은 6.7배 요동쳐요. 측정은 엔진별로 따로, 주기는 분기보다 14–30일로 돌려야 해요.

이 글처럼 AI가 답할 키워드 전략을 자동으로 세워보세요

TRAIL Search가 브랜드가 AI 검색에 어떻게 노출되는지 진단하고, 어떤 콘텐츠를 써야 인용되는지 처방해요.

AI 검색 가시성 진단하기

다른 글