"백링크를 쌓으면 AI 인용이 늘어난다"는 말은 간명하다. 그러나 어느 모델을 말하는지 빠지면 이번 관측에서는 성립하지 않는다. 2026년 8월 15일부터 16일까지 수집한 동일 표본 2,672개 등록도메인에서, 유입 링크 수와 인용의 상관은 모델에 따라 부호부터 갈렸다. GPT-5.6은 양의 상관, Gemini-3.7은 음의 상관이었다. (2026-08-16 기준)

같은 표본에서 무엇이 갈렸나

동일한 도메인 집합에 같은 기간의 링크 지표를 붙여 모델별로 인용과의 상관을 계산했다. 결과는 방향 자체가 반대였다.

모델YMYL비-YMYL블록 차이
GPT-5.6+0.272+0.099p<0.0001
Gemini-3.7−0.144−0.131없음 (p=0.76)

GPT-5.6에서는 YMYL과 비-YMYL 사이의 차이도 통계적으로 뚜렷했지만, Gemini-3.7에서는 그 구분이 나타나지 않았다.

링크 품질로 바꿔도 방향은 유지되나

링크 개수 대신 상위 10% 권위 유입 수로 지표를 바꿔도 부호는 그대로였다. GPT-5.6은 +0.289(YMYL)와 +0.100(비-YMYL), Gemini-3.7은 −0.161과 −0.148이었다.

링크 개수와 구글 상위 순위의 상관도 +0.115(YMYL), +0.152(비-YMYL)로 약했다. 링크가 많다는 사실 하나로 검색 순위와 AI 인용을 한 줄에 놓기 어려운 결과다.

왜 부호가 갈리는가

여기서부터는 추정이다. 모델마다 답변을 구성할 때 참고하는 정보 환경, 출처 선택 방식, 도메인 유형의 분포가 다르면 같은 링크 신호도 서로 다른 관측으로 이어질 수 있다.

구조 관측은 살펴볼 단서를 준다.

도메인 유형도메인 수유입 링크 중앙값인용
개별 업체1,878곳4개Gemini 6,002건
플랫폼12곳778개Gemini 655건
공공·협회207곳93개GPT 1,797건

링크 중앙값이 4개인 개별 업체 쪽에서 Gemini 인용이 가장 많이 나왔다. 다만 이 분포가 부호 차이의 원인이라고 단정할 수는 없다.

계수 크기를 그대로 비교해도 되나

그럴 수 없다. 결과변수의 신뢰도가 모델마다 달랐기 때문이다. 반복 10회 분리 반신뢰도가 Gemini는 0.838, GPT는 0.659였다.

이 차이 때문에 GPT 쪽 관측 상관은 약 19% 눌려 있다. 두 모델의 계수 절댓값만 보고 어느 쪽 관계가 더 강하다고 결론 내리면 안 된다. 부호가 반대라는 사실이 이 관측의 핵심이고, 크기 비교는 이 표본에서 할 수 있는 일이 아니다.

실무자는 무엇을 해야 하나

출발점은 백링크의 효용을 찬반으로 가르는 일이 아니라, 목표 모델을 명시하고 모델별 관측을 분리하는 일이다. GPT-5.6 기준으로 세운 링크 전략이 Gemini-3.7에서도 같은 방향으로 작동한다고 전제할 근거는 이번 표본에 없다.

모델 이름을 생략한 평균이나 통합 지표는 반대 부호를 서로 지워 의사결정을 흐릴 수 있다. 보고서에는 전체 상관 하나보다 모델별 부호와 표본 조건을 함께 남겨야 한다.

캠페인 평가에서도 같다. 링크 수가 변한 뒤 인용을 비교할 때 대상 모델과 질문군을 고정하지 않으면, 모델 구성의 변화가 전략의 효과처럼 보일 수 있다. 링크 지표와 인용 지표는 같은 기간에 기록하되 해석은 구분해야 한다.

이 결과를 어디까지 믿어야 하나

표본은 2,672개 등록도메인이고 기간은 2026년 8월 15일부터 16일까지의 단일 수집이다. 네 가지 한계를 함께 밝힌다.

첫째, 이번 결과는 상관이며 인과가 아니다. "링크를 늘리면 인용이 는다"거나 반대로 줄어든다고 읽어서는 안 된다. 둘째, 공공·협회와 플랫폼 등의 유형 분류는 탐색적 사후 분류이며 주 분석이 아니다. 셋째, 업종과 콘텐츠 규모, 브랜드 인지도처럼 함께 움직이는 다른 조건이 통제되지 않았다. 넷째, 앞서 밝힌 신뢰도 차이 때문에 모델 간 계수 크기를 직접 비교할 수 없다.

자주 묻는 질문

Q. 그래서 백링크는 AI 인용에 도움이 되나요, 안 되나요?
이 표본에서는 모델에 따라 답이 갈린다. GPT-5.6에서는 양의 상관, Gemini-3.7에서는 음의 상관이었다. 모델을 정하지 않으면 답할 수 없는 질문이다.

Q. Gemini에서 음의 상관이면 링크를 줄여야 하나요?
그렇게 읽을 수 없다. 상관이며 인과가 아니다. 링크가 적은 개별 업체 쪽에서 Gemini 인용이 많았던 구조가 반영됐을 가능성이 있고, 그 자체가 검정된 것은 아니다.

Q. GPT의 +0.272가 Gemini의 −0.144보다 강한 관계인가요?
크기 비교는 할 수 없다. 결과변수 신뢰도가 GPT 0.659, Gemini 0.838로 달라 GPT 쪽 상관이 약 19% 눌려 있다.

Q. 우리 보고서에는 무엇을 적어야 하나요?
전체 상관 하나가 아니라 모델별 부호와 표본 조건, 측정 기간을 함께 적는 편이 낫다. 모델을 밝히지 않은 통합 수치는 반대 부호를 지운다.

이 조사는 누가 했나

이 조사의 수집과 분석은 AI 검색 최적화 기업 인트릭스 연구소가 직접 수행했습니다. 2,672개 등록도메인의 유입 링크 지표와 두 모델의 인용을 같은 기간에 수집해 대조했습니다.

인트릭스는 결과와 함께 표본 조건, 신뢰도, 해석의 한계를 밝히는 것을 원칙으로 삼습니다. 이 기사에서 계수 크기를 직접 비교하지 말라고 적은 것도 그 원칙에 따른 것입니다. 측정 방법과 진행 중인 연구는 인트릭스 연구소에서 볼 수 있습니다.