동일 질의 749개 대상 4대 모델 비교 분석

동일한 제품 비교 질문을 입력하더라도 어떤 대화형 인공지능(AI)을 쓰느냐에 따라 추천되는 브랜드가 크게 달라진다는 조사 결과가 나왔습니다. AI 분석 및 모니터링 플랫폼 LLM 스카우트(LLM Scout)를 운영하는 런던의 AI 컨설턴트 프랭크 비테타(Frank Vitetta)가 공개한 연구 내용에 따르면, 주요 AI 어시스턴트 4곳은 동일한 상업적 평가 질의에 대해 브랜드 언급 여부에서 27%가 넘는 불일치를 보였습니다.

이번 조사는 LLM 스카우트가 9개월에 걸쳐 기록한 약 2만 7,000건의 AI 답변 데이터셋에서 추출한 749개의 동일 제품 선택 질의를 바탕으로 진행됐습니다. 비교 대상은 오픈AI의 챗GPT(ChatGPT), 앤스로픽의 클로드(Claude), 구글의 제미나이(Gemini), 퍼플렉시티(Perplexity) 등 4개 주요 생성형 엔진입니다.

분석 결과, 추적 대상 브랜드의 언급 여부를 두고 4개 플랫폼 간 의견이 엇갈린 비율은 27.2%에 달했습니다. 네 번 중 한 번 이상은 한 AI가 특정 브랜드를 전면에 내세울 때 다른 AI는 해당 브랜드를 전혀 언급하지 않는 현상이 나타난 셈입니다.

챗GPT, 타 모델 침묵 시에도 브랜드 호명 경향

조사 대상 모델 가운데 플랫폼별 동작 성향 차이도 확인됐습니다. 비테타의 분석에 따르면, 경쟁 모델들이 특정 브랜드를 거론하지 않고 침묵을 유지하는 상황에서도 챗GPT는 특정 상표명을 직접 호명할 가능성이 가장 높은 경향을 나타냈습니다.

연구팀은 이러한 차이가 기존 검색 엔진과 AI 검색 엔진 간의 근본적인 메커니즘 차이에서 비롯된다고 설명했습니다. 표준화된 알고리즘을 통해 웹페이지 색인과 순위를 매기던 전통적인 검색 엔진과 달리, 생성형 AI 모델들은 고유의 파운데이션 아키텍처, 독립적인 검색(retrieval) 엔진, 필터링 체계, 그리고 문맥 가중치 산정 방식을 각각 사용합니다. 이로 인해 동일한 질문이라도 엔티티(개체)를 식별하고 답변에 표출하는 방식이 모델마다 다르게 나타납니다.

단일 엔진 최적화 공식의 한계

이번 연구 결과는 생성형 엔진 최적화(GEO) 환경에서 단일 플랫폼만을 겨냥한 전략이 구조적 한계에 부딪힐 수 있음을 시사합니다. 한 플랫폼에서 높은 가시성을 확보했다고 해서 다른 AI 답변에서도 동일한 브랜드 인용을 보장할 수 없기 때문입니다.

이는 앞서 본지가 다룬 AI 최다 추천 업체 18곳 모두, 어떤 질문 표현에선 한 번도 안 나왔다는 분석 결과와도 맞닿아 있습니다. 질문 표현의 작은 변화뿐만 아니라 질문을 처리하는 모델 자체의 검색 엔진 차이가 브랜드 노출에 직접적인 변수로 작용하고 있습니다.

이러한 플랫폼 간 파편화는 AI 검색 시대, 전통 순위 측정 지표의 한계와 과제에서 짚었듯 기업들의 가시성 측정 방식에도 직접적인 변화를 요구합니다. 비테타는 단일 플랫폼에 집중된 최적화 방식으로는 충분하지 않으며, 각 엔진이 엔티티 참조를 처리하고 표출하는 독립적인 경로를 이해해야 한다고 짚었습니다.

이 사이트가 보는 지점

이번 조사는 AI 검색 가시성이 특정 모델 하나의 알고리즘이 아닌, 플랫폼별 독립적 검색 및 필터링 체계에 종속되어 있음을 수치로 드러냈습니다. 단일 엔진에서 확인된 인용 빈도를 브랜드의 전체 AI 가시성으로 일반화할 수 없다는 점이 명확해졌습니다. 결국 GEO 측정은 단일 순위 점검이 아니라 다중 모델에 걸친 엔티티 표출 일치도를 추적하는 방향으로 전환되어야 합니다.