쉽게 말하면
이 연구는 AI 검색엔진이 답변을 만들 때 특정 문서를 출처로 인용하도록 만드는 방법을 알아보고자 했습니다. 연구진은 AI 검색엔진의 인용 반응을 실시간으로 확인하면서 질문과 문서에 맞춰 글을 고쳐 쓰는 실험을 진행했습니다. 실험 결과 5개 출처가 균등하게 인용되는 기준(0.200)에서 인용 점유율이 0.205 및 0.198 늘어나 약 두 배 수준으로 높아졌습니다. 다만 이 연구는 성능 향상의 62%와 80%가 복잡한 기술보다는 사용자가 검색할 질문을 미리 알고 글을 고친 조건에서 나온 것이라고 설명합니다.
타깃 질문을 반영하는 인스턴스 단위 최적화
생성형 엔진은 검색 결과를 제공할 때 소수의 출처만을 선택적으로 인용합니다. 제논(Zenodo)에 공개된 마르친 코랄레프스키(Marcin Koralewski)의 연구 논문 ‘Query-Conditioned Generative Engine Optimization: Per-Document Reflective Search Against a Live Citation Oracle’에 따르면, 기존 생성형 엔진 최적화(GEO) 방식은 코퍼스 전체에서 공통 재작성 규칙을 도출하는 방식이 주를 이뤘습니다. 이로 인해 문서 재작성 과정에서 개별 검색 질문(Query) 정보가 배제되는 구조적 한계가 있었습니다.
연구진은 키워드 단위의 기존 검색엔진 최적화(SEO)처럼 타깃 질문을 미리 파악할 수 있는 상업적 환경에 주목했습니다. 이에 따라 질문과 문서 쌍에 맞춰 재작성 지침을 진화시키는 반사형 최적화 프레임워크 ‘RIO’를 제시했습니다. RIO는 원본 문서의 충실도를 유지하면서 실제 엔진의 인용 행동 데이터를 측정해 문서를 수정합니다.
인용 점유율 상승과 질문 인지 효과
두 가지 벤치마크를 통해 12개 실험군을 단일 채점 경로와 재작성 모델로 평가한 결과, 인용 점유율은 약 두 배 증가했습니다. 5개 소스가 0.200씩 점유하는 균등 분할 기준에서 각각 0.205와 0.198 상승한 수치입니다.
그러나 소제(Ablation) 분석 결과, 성능 향상분의 대부분인 62%와 80%는 최적화 알고리즘 메커니즘 자체가 아니라 ‘타깃 질문을 사전에 알고 있었다는 점’에서 발생한 것으로 나타났습니다. 정보 조건이 완전히 동일한 환경에서는 기존의 코퍼스 기반 글로벌 규칙이 RIO보다 유의미하게 높은 성능을 보였습니다. 한편 질문 조건부 최적화는 질문을 배제한 재작성 방식에서 발생하는 어휘적 검색 가능성(lexical retrievability) 저하 문제를 보존하는 특징을 보였습니다.
연산 효율성과 엔진별 적용 한계
연구진은 RIO의 연산 효율성도 함께 측정했습니다. 예산을 맞춘 샘플러와 비교했을 때, 반사형 최적화 방식은 3분의 1 수준의 엔진 호출만으로 동일한 점수에 도달했습니다.
엔진 모델을 변경했을 때도 인용 점유율 이득은 유지되었으나, 그 효과는 3분의 2 수준으로 감소했습니다. 또한 테스트 대상 중 가장 성능이 강력한 엔진일수록 인용 결과를 변화시키기 가장 어려운 것으로 확인되었습니다.
논문은 최적화 메커니즘보다 적용 환경의 특성이 더 중요하다고 결론지었습니다. 타깃 질문이 명확히 알려져 있고 개별 문서에 연산 자원을 투입할 가치가 있는 경우에는 질문 조건부 최적화가 적합하지만, 그렇지 않은 일반적인 환경에서는 기존의 코퍼스 마이닝 규칙을 적용하는 방식이 여전히 유효하다고 연구진은 밝혔습니다.




