쉽게 말하면
코넬 테크 연구진이 AI 검색 도구가 인터넷 게시판 글을 어떻게 인용하는지 실험했습니다. 연구진이 AI가 자주 읽는 커뮤니티 글의 복사본에 추천 문구를 끼워 넣자, AI가 그 복사본을 읽었을 때 최종 답변에 그 내용이 들어갈 확률이 38~51%였습니다. 13개 영단어짜리 짧은 문구도 답변에 들어갔습니다. AI가 사람들의 실제 후기가 모인 커뮤니티를 신뢰도 높은 정보원으로 자주 참고하다 보니, 아주 짧은 조작 문구에도 쉽게 영향을 받는다는 점이 확인됐습니다.
플랫폼 전반으로 확산된 AI 생성 콘텐츠 단속
생성형 AI를 활용한 대량 콘텐츠 생성이 보편화되면서 디지털 플랫폼들이 저품질 게시물 차단에 속도를 내고 있습니다. 중국 생활 정보 플랫폼 따중뎬핑(Dianping)은 지난 한 해 동안 AI가 생성한 허위 리뷰 1,161만 건을 적발해 삭제했습니다. 프랑스 음악 스트리밍 서비스 디저(Deezer)는 매일 플랫폼에 업로드되는 신규 음원의 절반 가까이가 AI로 생성된 음원이며, 봇 계정에 의해 재생 수가 조작되고 있다고 밝혔습니다. 스포티파이 역시 지난해 7,500만 건의 저품질 트랙을 플랫폼에서 정리했습니다.
소셜 네트워크 서비스에서도 대응책이 가동되고 있습니다. 링크드인은 'AI 스팸으로 보임' 신고 버튼을 도입한 이후 AI가 작성한 직무·경영 관련 글의 조회수가 40% 감소했습니다. 스냅챗은 올해 7월부터 자체 숏폼 플랫폼인 스포트라이트 추천 목록에서 순수 AI 생성 비디오를 제외하고, AI 편집물에 대해서는 라벨 부착을 의무화했습니다. 핀터레스트와 틱톡 역시 홈 피드에서 AI 생성 콘텐츠의 노출 비중을 사용자가 직접 줄일 수 있는 제어 기능을 도입하거나 테스트 중입니다.
인간 데이터 찾는 AI 검색, 마케팅 표적이 된 UGC
플랫폼들의 스팸 규제에도 불구하고 마케팅 영역에서는 AI 검색 엔진의 인용을 노린 역최적화(GEO 및 AEO) 움직임이 사용자 커뮤니티(UGC)로 이동하고 있습니다. 대형 언어 모델 개발사들이 학습 데이터와 실시간 검색 소스로 레딧(Reddit)과 같은 커뮤니티와 제휴를 맺자, 특정 브랜드나 성분을 자연스러운 후기 형태로 위장해 게시하는 사례가 늘어난 것입니다.
사람에게는 부자연스럽게 읽히는 구체적 브랜드명, 제품 스펙, 인증 기관 나열 형태의 게시글이 오히려 구조화된 데이터를 찾는 AI 엔진에는 손쉬운 인용 소스로 분류되는 역설이 발생합니다. 앞서 본지가 보도한 AI 제품 추천 답변 86%, 제휴·광고 출처 인용했다 사례나 AI 검색 속 가짜 고객센터, 374개 브랜드 낚였다 사건과 마찬가지로, AI가 신뢰성 높은 출처로 분류한 공간이 집중적인 인용 조작의 통로로 쓰이는 양상입니다.
코넬 테크 실험: 변조 게시물 읽은 AI, 38~51% 확률로 삽입 문구 답변에 반영
이러한 취약성은 실제 기술 실험을 통해서도 입증됐습니다. 미국 코넬 테크(Cornell Tech) 연구진은 3개 오픈소스 AI 리서치 도구에 176개 질문을 입력하고 AI가 참조하는 외부 출처를 분석하는 실험을 진행했습니다.
실험 결과, AI 도구들이 참조한 전체 소스의 약 20%가 사용자 생성 커뮤니티 콘텐츠였으며, 그중 레딧이 절반 이상(전체 크롤링 URL의 약 12%)을 차지했습니다. 인덱싱되는 소스는 동일 질문에 대해 표현 방식을 바꾸더라도 일정하게 유지되는 특성을 보였습니다.
연구진은 AI가 자주 인덱싱하는 게시물의 복사본을 생성한 뒤 그 안에 특정 식당이나 앱, 제품 이름을 담은 문구를 추가해 AI 도구에 제공했습니다. 그 결과 AI가 변조된 복사본을 읽었을 때 추가된 홍보성 정보가 최종 답변에 포함될 확률은 38%에서 51%로 나타났습니다. 단일 질문에 대해 참조되는 복수의 소스에 동일한 방식으로 내용을 주입했을 때는 이 확률이 최대 62%까지 상승했습니다. AI 답변을 유도하는 데 필요한 최소 문구 길이는 13개 영단어에 불과했습니다.
이 사이트가 보는 지점
AI 검색 엔진이 신뢰성 높은 '인간 데이터'를 확보하기 위해 커뮤니티에 대한 참조 의존도를 높이는 사이, 오히려 그 지점이 가장 취약한 인용 조작 경로가 될 수 있음을 보여줍니다. 변조된 게시물을 읽은 경우 38~51% 확률로 삽입 문구가 답변에 실렸고 13개 영단어짜리 문구도 통했다는 것은, AI가 출처를 선택하고 신뢰성을 검증하는 알고리즘이 문맥의 진위 여부보다 특정 개체명의 출현 빈도와 구조에 크게 반응하고 있음을 나타냅니다. 향후 엔티티 검증과 데이터 출처 검증 장치가 강화되지 않는다면 AI 인용 점유율 측정값 자체가 오염된 데이터에 의해 왜곡될 수 있습니다.




