사람 눈엔 예쁜 홈페이지가, AI에겐 빈 페이지인 이유
사람 눈엔 예쁜 홈페이지가, AI에겐 빈 페이지인 이유
[검색 노출용 요약 · 160자] 수백만 원 들인 홈페이지가 AI 답변에는 왜 안 나올까요. AI는 사람이 보는 형태로 글을 수집하지 않기 때문입니다. 프린스턴대 KDD 2024 논문이 1만 개 질의로 검증한 'AI가 인용하는 글쓰기'를 수치 그대로 정리했습니다. 시리즈 3편.
수백만 원을 들여 만든 홈페이지.
감성적인 사진, 세련된 배너, 정성 들인 소개 문구.
그런데 AI에게 물어보면 우리 가게 이야기가 전혀 나오지 않습니다.
이유는 간단합니다. AI는 사람이 보는 형태로 글을 수집하지 않기 때문입니다.
오늘은 이 차이를 원리부터 설명하고, "그럼 어떤 글이 통하는가"를 — 감이 아니라 — 동료 심사를 거친 학술 논문의 실험 수치로 보여드리겠습니다.
이미지 속 글자는, 글자가 아닙니다
1편에서 AI는 텍스트를 토큰이라는 숫자 조각으로 잘라 읽는다고 했습니다.
여기서 중요한 함의가 나옵니다.
이미지 안에 있는 글자는, 기본적으로 텍스트가 아닙니다.
가격표를 예쁜 이미지로 만들어 올리셨다면 — 사람 눈에는 정보지만, AI 크롤러에게는 그림 파일 하나입니다.
메뉴, 시술 안내, 수업 커리큘럼, 영업시간이 전부 통이미지 배너 속에 있다면, 그 페이지는 AI에게 사실상 빈 페이지에 가깝습니다. 인용은커녕, 후보 검토 대상에도 오르지 못합니다.
AI는 키워드가 아니라 '관계'를 읽습니다
AI 내부에는 attention(어텐션)이라는 장치가 있습니다. 2017년 구글 연구진의 논문 "Attention Is All You Need"에서 나온 개념으로, 오늘날 모든 LLM의 뼈대입니다.
역할은 이렇습니다. 지금 처리 중인 단어가 앞선 문맥의 어떤 단어들을 얼마나 참고할지, 그 비율을 계산하는 눈입니다.
"그 소믈리에는 손님에게 그녀의 추천 와인이…"라는 문장에서 '그녀'가 소믈리에를 가리킨다는 것을, AI는 이 장치로 알아냅니다. 참고 비율은 규칙으로 정해진 게 아니라 데이터에서 스스로 배운 것입니다.
단어는 혼자 해석되지 않습니다. 문맥 속 관계로 해석됩니다.
이게 콘텐츠에 주는 교훈은 명확합니다.
AI는 키워드를 세는 기계가 아니라 구조와 관계를 읽는 기계입니다. "성수 와인바 성수 와인바"를 반복해 박아 넣는 옛날 방식은 통하지 않습니다 — 이건 저희 추측이 아니라 실험 결과입니다. 바로 아래에서 보여드리겠습니다.
프린스턴 논문 — 1만 개 질의로 검증한 '통하는 글쓰기'
2024년, 프린스턴대·조지아텍·IIT 델리·앨런AI연구소 연구진이 세계적 데이터마이닝 학회 ACM KDD 2024에 "GEO: Generative Engine Optimization"이라는 논문을 발표했습니다. 이 분야 최초의 동료 심사 학술 연구입니다.
실험 설계는 이렇습니다. 다양한 분야의 사용자 질의 1만 개(GEO-bench)를 만들어 AI 답변 엔진에 던지고, 같은 콘텐츠를 9가지 방식으로 수정했을 때 AI 답변 속 가시성(인용·언급 비중)이 어떻게 변하는지 측정했습니다.
결과를 수치 그대로 옮기면 —
✅ 효과가 검증된 방법
통계 수치 추가 — 정성적 서술을 구체적 숫자로 바꾸는 것만으로 가시성 약 40% 상승. 가장 강력한 단일 기법
출처 인용(Cite Sources) — 주장에 근거 출처를 다는 방식, 주요 지표에서 약 28% 개선
전문가·관계자 인용문 추가 — 통계·출처와 함께 상위 3대 기법
문장 유창성 개선 — 내용 추가 없이 문장만 명확하게 다듬어도 약 28% 개선. 읽기 어려운 글은 AI가 요약·인용하기도 어렵다는 뜻
❌ 효과가 없거나 역효과였던 방법
키워드 반복(keyword stuffing) — 생성형 환경에서 성과가 나빴습니다. 전통 SEO의 대표 꼼수가 AI 시대에는 통하지 않는다는 실험적 확인
그리고 하나 더, 사장님들께 특히 중요한 발견입니다.
검색 순위 1위 페이지는 최적화해도 변화가 적었지만, 5위권 페이지는 가시성이 최대 115%까지 개선됐습니다
즉 — 이미 유명한 대형 브랜드보다, 아직 상위권이 아닌 중소 업장에게 개선 여지가 훨씬 큰 게임입니다.
후속 연구도 방향이 같습니다. 2025년 발표된 C-SEO Bench 벤치마크 연구는 시중에 도는 '대화형 검색 꼼수' 상당수가 효과가 없거나 오히려 해롭고, 결국 콘텐츠 자체의 관련성이 계속 작동한다고 결론지었습니다.
정리 — AI가 인용하는 글 vs 지나치는 글
원리와 논문을 합쳐 실무 언어로 정리하면 이렇습니다.
✅ AI가 잘 인용하는 글
질문형 소제목 아래, 바로 답이 나오는 즉답 단락
"수업은 2시간, 크루그 포함 샴페인 4종 테이스팅"처럼 수치와 구체 정보가 있는 문장
가격 · 대상 · 진행 방식 · 운영 정보가 텍스트로, 정리된 형태로 존재
근거와 출처가 달린 서술
그 업장만 쓸 수 있는 구체적인 경험과 기록
❌ AI가 지나치는 글
감성적 도입부만 길고 정보는 뒤에 숨은 글
"최고의 만족을 약속합니다" 같은 근거 없는 분위기 서술
이미지 안에 갇힌 핵심 정보
키워드를 억지로 반복한 글 — 논문에서 역효과 확인
어느 업장에 붙여도 되는 무난한 복붙형 문장
흥미로운 것은, 플랫폼들의 공식 입장도 전부 같은 방향이라는 점입니다.
구글은 2026년 5월 공식 가이드에서 어디서나 볼 수 있는 'commodity 콘텐츠'가 아니라, 직접 경험과 고유 관점이 담긴 'non-commodity 콘텐츠'가 AI 검색 가시성의 핵심이라고 명시했습니다. 네이버 역시 대가성·복제성 콘텐츠가 아닌, 자신만의 경험이 담긴 글이 우대받는다고 공식 블로그를 통해 반복 안내해 왔습니다.
학술 논문, 구글, 네이버 — 세 곳이 다른 언어로 같은 말을 하고 있습니다.
남의 글을 돌려 쓴 흔적이 아니라, 그 업장만의 축적된 기록.
'AI한테 써달라고 한 글'의 함정
여기서 오해 하나를 짚겠습니다.
"ChatGPT한테 글 써달라고 하면 되는 것 아닌가요?"라는 질문을 많이 받습니다.
'AI가 쓴 글'과 'AI가 인용하는 글'은 다른 개념입니다.
아무 맥락 없이 생성된 글은 정확히 위에서 말한 '어느 업장에 붙여도 되는 무난한 문장' — 구글이 말한 commodity 콘텐츠가 되기 쉽습니다. 참고로 구글은 AI로 글을 쓰는 것 자체는 문제 삼지 않지만, 가치 없는 페이지를 대량으로 찍어내는 것은 스팸 정책 위반으로 본다고 명시했습니다.
인용 후보가 되려면 실제 업장의 데이터가 필요합니다. 가격, 위치, 사진, 고유의 말투, 실제 수업과 시술과 경험. 그것이 논문이 검증한 구조 — 수치, 출처, 즉답, 유창한 문장 — 위에 얹혀야 합니다.
BrandBloom이 사진 몇 장과 방향성 몇 줄을 받아서, 업장 정보와 예상 고객 질문을 분석한 뒤 글을 만드는 이유가 이것입니다. 저희 AEO 전용 파인튜닝 모델이 하는 일은 '글 생성'이 아니라, 업장의 실제 정보를 — 연구로 검증된 인용 친화 구조로 — 재구성하는 일입니다.
이 작업을 통틀어 GEO(Generative Engine Optimization)라고 부릅니다. 이제는 학회 논문 제목이기도 한, 정식 명칭입니다.
읽히지 않으면, 애초에 후보에도 오르지 못하니까요.
오늘의 세 문장 요약
이미지 속 정보는 AI에게 정보가 아닙니다 — 텍스트와 구조로 존재해야 인용 후보가 됩니다.
KDD 2024 논문 기준, 통계 추가 약 40%, 출처·유창성 약 28% 가시성 개선. 키워드 반복은 역효과.
1위보다 5위권 페이지가 최대 115% 개선 — 이 게임은 중소 업장에게 더 유리하게 열려 있습니다.
다음 편 예고
AI가 우리 글을 읽었다고 끝이 아닙니다.
AI의 '지식'은 언제, 어떻게 업데이트될까요. 학습된 기억과 실시간 검색이라는 두 갈래 경로, 그리고 왜 축적에 2~4개월이 걸리는지를 다룹니다.
👉 BrandBloom 시작하기 — brandbloom.kr
참고 자료
Aggarwal et al., "GEO: Generative Engine Optimization", ACM KDD 2024 (DOI: 10.1145/3637528.3671900) — GEO-bench 1만 질의, 9개 기법 실험
Puerto et al., "C-SEO Bench" (2025) — 대화형 검색 최적화 기법 벤치마크
Vaswani et al., "Attention Is All You Need" (NeurIPS 2017)
Google Search Central, "Optimizing your website for generative AI features on Google Search" (2026.5) — non-commodity 콘텐츠, AI 생성 콘텐츠·스팸 정책
네이버 서치앤테크 공식 블로그 — 검색 콘텐츠 품질 기준 안내
※ AI 검색 노출은 질문, 시점, 경쟁 상황 및 플랫폼 정책에 따라 달라지는 확률의 영역이며, 특정 결과를 보장할 수 없습니다. 인용된 개선 수치는 해당 논문의 실험 조건에서 측정된 값으로, 모든 상황에서 동일하게 재현된다는 뜻이 아닙니다.