쉽게 말하면
AI에게 과거 대화 기록이 있는 계정으로 질문했을 때와 아무 기록 없는 계정으로 질문했을 때 추천해 주는 브랜드가 달라진다는 점을 밝혀낸 연구입니다. 제미나이와 챗GPT 같은 모델은 사용자 이력에 따라 전혀 다른 브랜드를 반복적으로 추천했으며, 특히 사용자의 지역 맥락에 반응해 현지 브랜드와 사이트 인용을 늘렸습니다. 이에 따라 단일 계정이나 순수 API로만 브랜드 노출 여부를 점검하는 기존 측정 방식은 실제 사용자가 마주하는 AI 답변을 완전히 담아내지 못할 수 있습니다.
사용자 맥락이 바꾸는 AI의 브랜드 추천
AI 검색 및 생성형 엔진이 추천하는 브랜드 목록이 사용자의 누적된 이력과 맥락에 따라 달라진다는 실증 연구 결과가 발표되었습니다. AI 가시성 컨설턴트 캐시 윌슨 클라크(Cassie Wilson Clark)와 프릭션 AI(friction AI)의 공동 창립자 주앙 다 실바(Joao da Silva)가 영국에서 진행한 연구에 따르면, AI 모델이 사용자에 대해 축적한 정보가 지속적인 브랜드 추천 결과에 직접적인 변화를 주는 것으로 나타났습니다.
연구진은 영국 환경에서 6개 페르소나, 3개 소비자 카테고리, 30개 프롬프트를 바탕으로 9일 동안 챗GPT(ChatGPT), 제미나이(Gemini), 클로드(Claude), 퍼플렉시티(Perplexity)에서 총 8,609개의 AI 응답을 수집해 분석했습니다. 검색 기록이 없는 순수 API 상태, 임시 로그인 세션, 과거 사용자 이력이 축적된 계정 상태를 각각 비교 대조하는 방식으로 진행되었습니다.
제미나이 33.3%p·챗GPT 16.0%p 분기… 모델별 편차 뚜렷
연구 결과, 일상적인 응답 변동 폭(Volatility Floor)을 제외하고도 사용자 이력과 결합해 나타난 브랜드 세트의 분기 폭은 플랫폼마다 큰 차이를 보였습니다. 캐시 클라크 마케팅 자료에 따르면 제미나이는 33.3%포인트의 분기율을 기록하며 조사 대상 4개 플랫폼 중 개인화에 따른 브랜드 세트 변화가 가장 컸습니다. 챗GPT는 16.0%포인트, 퍼플렉시티는 7.2%포인트의 분기율을 나타냈습니다.
반면 앤트로픽의 클로드는 사용자 맥락이 입력되었을 때 검색 동작 자체는 변화했으나, 통상적인 변동성을 넘어서는 수준의 지속적인 브랜드 세트 변화는 관측되지 않았습니다. 연구진은 사용자 맥락이 존재할 때와 존재하지 않을 때 나타나는 이 측정 가능한 브랜드 추천 차이를 '개인화 격차(Personalization Gap)'로 정의했습니다.
지역성 신호의 개입과 API 기반 측정의 한계
이번 연구에서 가장 뚜렷하게 관측된 개인화 변수는 사용자의 지리적 맥락이었습니다. 사용자 이력이 주입된 영국 계정 환경에서는 이력이 없을 때와 비교해 영국 및 유럽연합(EU) 기반 브랜드 점유율이 6.6%포인트 상승한 반면, 미국 기반 브랜드 점유율은 4.9%포인트 감소했습니다. 또한 답변에 인용된 출처 중 '.uk' 도메인 비중은 6.0%포인트 증가했습니다.
이러한 변화는 고정된 단일 쿼리 점검 방식의 측정 체계에 구조적 질문을 던집니다. 173개 대조군을 비교한 결과, 이력이 없는 API 샘플링 방식은 이력이 축적된 계정에서 반복 노출된 추천 브랜드의 79%만을 복원하는 데 그쳤습니다. 임시 로그인 세션이 95%를 포착한 것과 비교하면 21%의 추천 브랜드를 측정 단계에서 놓친 셈입니다.
연구진은 이번 결과가 API 기반 측정 도구를 무효화하는 것은 아니지만, 단순한 화면 캡처나 일회성 API 조회를 넘어 표본 수집 깊이와 사용자 맥락을 고려한 측정 설계가 필요함을 시사한다고 짚었습니다. 브랜드 노출 누락을 단순한 콘텐츠 부족 문제로만 치부하기보다, 검색 엔진의 인용 메커니즘과 사용자 맥락 신호가 어떻게 상호작용하는지 살펴야 한다는 분석입니다.
이 사이트가 보는 지점
이번 연구는 AI 검색 최적화(GEO)에서 ‘모두에게 동일하게 노출되는 단일 정답’이라는 전제가 더 이상 유효하지 않음을 보여줍니다. 기존에 본지가 다룬 AI 가시성 점수의 착시… 인용·언급 분리 없는 측정의 맹점과 맞물려, API 호출 기반의 정적 모니터링이 실제 사용자 세션의 인용 결과를 최대 21%까지 누락할 수 있다는 측정적 한계가 구체적 수치로 입증되었습니다. 결국 브랜드의 키워드 순위에서 인용 중심으로, GEO 실무 프레임워크를 수립할 때 단일 순위 점검이 아닌 표본 수집 깊이와 사용자 페르소나별 맥락 신호를 측정 모델에 통합해야 하는 과제가 주어졌습니다.




