쉽게 말하면
미국 워싱턴대학교 연구팀이 구글의 AI 검색 요약 기능인 'AI 개요' 5만 5천여 건을 분석했습니다. 그 결과 AI가 작성한 문장 중 약 11%는 연결된 출처 웹사이트에 근거 내용이 아예 없거나, 출처 내용과 반대로 적혀 있었습니다. 또한 AI 답변 속 모든 문장이 출처와 완벽히 맞아떨어지는 답변은 10개 중 4개(41.9%) 수준에 그쳤습니다. 아울러 AI가 참고한 사이트 10곳 중 3곳은 일반 검색 1페이지에 나오지 않는 곳이었습니다.
5만 5천 건 검색 감사… 질문형 검색 65%에 AI 개요 등장
미국 세인트루이스 워싱턴대학교(WashU) 연구팀이 2026년 3월 13일부터 4월 21일까지 40일간 트렌드 주제를 대상으로 55,393건의 구글 검색을 수행해 분석한 결과를 발표했습니다. 2026년 10월 ACM 인터넷 측정 학술대회(Internet Measurement Conference)에서 발표될 이번 연구는 구글 AI 개요(AI Overviews)의 노출 패턴과 출처 인용 구조를 대규모로 추적했습니다.
연구에 따르면 전체 검색어 중 AI 개요가 노출된 비율은 13.7%였습니다. 검색어 형태에 따라 노출 편차는 컸습니다. 질문 형태의 검색어에서는 64.6%(약 65%) 비율로 AI 개요가 나타났으나, 비질문형 검색어에서는 9.5%에 머물렀습니다. 검색어 길이가 길어질수록 AI 개요 생성 확률도 높아졌습니다. 비질문형 검색어 기준 1단어 검색어의 AI 개요 노출률은 9.9%였던 반면, 6단어 이상 검색어에서는 38.7%로 상승했습니다.
주제별 노출 빈도도 큰 차이를 보였습니다. 취미 및 여가 관련 검색어의 46.1%, 과학 관련 검색어의 39.9%에서 AI 개요가 활성화된 반면, 정치 관련 검색어는 7.5%, 법률 및 정부 관련 검색어는 9.6%에 그쳤습니다.
인용 도메인 29.8%, 1페이지 일반 검색 결과 밖에서 유입
연구팀이 수집한 61,212건의 인용을 분석한 결과, AI 개요는 답변 하나당 평균 약 8개의 출처를 인용했습니다. AI 개요가 인용한 웹사이트 도메인은 같은 검색어의 일반 1페이지 검색 결과보다 평균 신뢰도 점수가 높았으며, 사용자 생성 콘텐츠(UGC) 의존도는 더 낮았습니다.
주목할 점은 AI 개요가 인용한 도메인의 29.8%가 1페이지 일반 검색 결과에 포함되지 않은 도메인이었다는 사실입니다. 이는 앞서 구글 AI 개요 인용 중 톱10 비중 38%로 급감 기사에서 다룬 흐름처럼, 구글이 기존 랭킹 시스템과 분리된 별도의 출처 선별 파이프라인을 가동하고 있음을 보여줍니다.
주장 11%는 출처 불일치… 전체 주장이 완전 일치한 개요는 41.9%
신뢰할 수 있는 출처를 인용했더라도 생성된 요약문의 정확성이 완전히 보장되지는 않았습니다. 연구팀은 AI 개요에서 추출한 98,020개의 검증 가능한 주장(claims)을 실제 인용된 웹페이지 본문과 대조했습니다.
- 출처 일치(89%): 수집된 인용 문서 본문에서 명확하거나 광범위하게 사실이 뒷받침된 비율
- 출처 부재(7%): 연구팀이 수집한 인용 문서 텍스트 내에서 해당 주장의 근거를 찾을 수 없는 비율
- 출처 모순(4%): 인용 문서에 적힌 사실과 AI 개요의 주장이 서로 상충하는 비율
AI 개요 내 모든 검증 가능한 주장이 수집된 출처 본문과 일치하는 '완전 근거(fully grounded)' 개요는 전체의 41.9%에 불과했습니다. 연구팀은 레딧이나 포럼, 유튜브 영상 등 동적 콘텐츠나 시시각각 바뀌는 정보(날씨, 휴교령 등)가 파이프라인 수집 과정에서 누락되었을 가능성을 고려해 11%의 오류율이 상한선 성격이라고 설명했습니다.
웹 퍼블리셔 트래픽 손실과 플랫폼 광고 수익 구조
연구팀은 AI 개요가 웹 퍼블리셔의 광고 수익 모델에 미칠 잠재적 영향도 짚었습니다. AI 개요가 인용한 웹페이지의 50% 이상이 광고를 게재하고 있는 사이트였습니다. 검색 이용자가 검색 결과 화면에서 답을 얻고 원본 웹사이트로 이동하지 않으면 퍼블리셔의 광고 및 구독 수익 기반이 약화될 수 있습니다.
동시에 AI 개요가 나타난 검색 결과 페이지 중 2.2%에는 구글 스폰서 광고가 함께 노출되었습니다. 이 가운데 39건은 AI 개요 영역 상단에 광고가 배치되었습니다. 연구팀의 제이콥 몽고메리(Jacob Montgomery) 교수는 퍼블리셔가 비용을 들여 제작한 콘텐츠를 기반으로 AI 답변이 생성되는 만큼, 플랫폼과 원작자 간의 라이선스 및 수익 배분 협의가 이뤄지지 않으면 장기적으로 출처 생태계가 유지되기 어렵다고 지적했습니다.
이 사이트가 보는 지점
이번 조사는 AI 검색이 '신뢰도 높은 출처'를 인용하더라도 그것이 곧 '답변 내용의 진실성'을 담보하지 않는다는 점을 명확히 보여줍니다. 기존 전통 검색 순위 1페이지에 들지 못한 웹사이트가 인용 도메인의 30% 가까이 차지한다는 사실은, 검색 순위 중심의 최적화와 인용 대상 중심의 최적화가 명확히 갈라졌음을 다시 입증합니다. AI 엔진이 웹 문서를 읽고 요약하는 과정에서 11%의 사실 왜곡 및 근거 누락이 발생한다는 점은 향후 엔티티 단위의 명확한 서술과 정형화된 데이터 제공이 왜 중요한지 보여주는 측정 지표입니다.




