쉽게 말하면

이 연구는 웹 문서의 내용을 일부러 조작해 인공지능 검색이 엉뚱하거나 왜곡된 답변을 인용하도록 만드는 공격을 기존 보안 장치가 얼마나 막아내는지 측정하려 했습니다. 연구진은 사람이 직접 검증한 247개의 질문을 바탕으로 정보를 그대로 유지한 문서와 정보를 왜곡한 문서를 만든 뒤, 3종의 언어모델 환경에서 보안 장치들을 시험했습니다. 그 결과 널리 쓰이던 3가지 보안 시스템은 조작된 문서의 침투를 막아낸 비율이 상대적으로 최대 5.7%에 그쳤고, 한 시스템은 통계적으로 의미 있는 차이를 내지 못했습니다. 연구진은 기존 안전망이 욕설이나 유해 문장만 잡도록 설계되어 자연스럽게 쓰인 왜곡 문서를 가려내지 못한다고 분석하며, 공격 성공률을 47.6% 낮추는 새로운 기본 방어 모델을 제시했습니다.

기존 가드레일, 정보 왜곡형 GEO 공격에 최대 5.7% 방어

생성형 엔진 최적화(GEO) 기법을 악용해 대형언어모델(LLM) 기반 검색 엔진에 의도적으로 왜곡된 정보를 주입하는 공격에 대해, 기존 상용 보안 가드레일들이 사실상 무력하다는 벤치마크 평가 결과가 공개됐다.

빙 정(Bing Zheng), 종야오 자오(Zongyao Zhao), 원밍 양(Wenming Yang) 연구진이 발표하고 EMNLP 2026 메인 콘퍼런스에 채택된 논문 'Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization'에 따르면, 기존 안전 가드레일 모델들은 유창하게 작성된 정보 왜곡형 웹 문서를 효과적으로 차단하지 못하는 것으로 나타났다.

247개 검증 질의 기반 '카운터 GEO 벤치' 구축

연구진은 통제된 환경에서 이러한 위협과 방어 성능을 평가하기 위해 '카운터 GEO 벤치(Counter-GEO-Bench)'를 설계했다. 이 벤치마크는 사람이 직접 품질을 검증한 247개의 질의를 바탕으로, 본래 정보를 보존한 GEO 재작성 문서와 정보를 왜곡한 GEO 재작성 문서를 쌍으로 구성했다.

평가는 3종의 피해 LLM을 대상으로 공격 성공률(Attack Success Rate, ASR), 오탐률(False Positive Rate), 답변 품질 지표를 측정하는 방식으로 이뤄졌다. 논문에 따르면 기존에 널리 쓰이던 3종의 기성 방어 시스템(Granite Guardian, Llama Guard 3, NeMo Self-Check Fact-Checking)을 적용한 결과, 공격 성공률 감소 폭은 상대 수치 기준 최대 5.7%에 불과했다. 특히 'Granite Guardian'이 보인 감소 폭은 통계적으로 유의미하지 않은 수준으로 분석됐다.

안전 정책 필터링의 한계와 전용 방어 기준선

연구진은 기존 안전 가드레일이 유해성이나 정책 위반 분류 체계를 중심으로 설계되었기 때문에 이러한 한계가 발생한다고 짚었다. GEO 기법을 적용한 왜곡 정보는 문법적으로 유창하고 겉보기에 일반적인 정보성 콘텐츠 형태를 띠고 있어, 기존 정책 기반 필터를 그대로 통과한다는 설명이다.

논문에서는 이러한 위협에 대응할 수 있음을 보이기 위해 경량 벤치마크 베이스라인 모델인 'C-GEO 가드(C-GEO Guard)'를 함께 제시했다. 연구진의 측정 결과 C-GEO 가드는 답변 유용성 손실을 거의 일으키지 않으면서 공격 성공률을 상대 수치 기준 47.6% 줄였다.

이 사이트가 보는 지점

생성형 검색 엔진이 인용 대상을 선택할 때 구조적 최적화와 문맥의 유창성을 신호로 삼는다는 점은 역으로 왜곡된 정보가 인용 풀에 침투하기 쉬운 취약점이 됩니다. 앞서 AI 검색 인용 10건 중 1건은 '근거 불일치'… 출처 검증 시험대AI 챗봇, 허위 선전 광고 방어율 일반 검색 앞서… AI 요약은 편차 커 기사에서 짚었듯, 요약의 신뢰도는 개별 인용 출처의 진위 검증과 직결되어 있습니다. 이번 연구는 유해성 차단에 초점을 맞춘 범용 가드레일만으로는 최적화된 왜곡 문서의 검색 인용을 걸러내기 어렵다는 점을 수치로 드러냈습니다. 앞으로 AI 검색 서비스가 인용 알고리즘에 단순 적합도 외에 사실 왜곡 감지 계층을 어떻게 결합할 것인지가 측정 체계의 중요한 변수가 될 것입니다.