생성형 AI 검색 최적화(GEO, Generative Engine Optimization)는 ChatGPT, Gemini, 구글 AI 개요, 네이버 AI 브리핑처럼 질문에 답변을 직접 써 주는 서비스가 회사 사이트를 읽고 출처로 인용할 수 있게 사이트를 정비하는 일입니다. 그러려면 AI 크롤러(crawler, 웹 페이지를 돌아다니며 글을 읽어 가는 프로그램)가 페이지를 가져갈 수 있어야 하고, 페이지가 질문에 바로 답해야 하며, AI가 그 회사를 정확히 알아볼 근거가 사이트 안에 있어야 합니다.
검색엔진 최적화(SEO)를 해 온 회사라면 이미 갖춘 것이 많습니다. 달라지는 부분은 구글 밖 AI 서비스의 크롤러 설정과, AI가 회사를 정확히 알아보게 돕는 정보입니다. 설정 예시부터 보고 싶다면 AI 검색 최적화 체크리스트로 바로 넘어가도 됩니다.
한눈에 보기
- GEO는 ChatGPT 같은 AI가 답변을 쓸 때 우리 회사 사이트를 근거로 삼고 출처 링크를 달게 만드는 준비 작업입니다.
- 바탕은 기존 검색엔진 최적화(SEO)이고, AI 서비스별 크롤러 허용과 회사 정보를 기계가 읽는 형태로 적는 일이 더해집니다.
- 2023년 GEO 논문 실험에서는 근거·수치·인용을 더한 글이 답변에 더 많이 쓰였고, 키워드를 반복하는 방식은 통하지 않았습니다.
케이크 가게 사장님의 고민
성수동에서 수제 케이크 가게를 하는 사장님이 있다고 해 봅시다. 예전에는 손님이 네이버나 구글에 "성수동 케이크"를 검색하고, 결과 목록에서 가게 블로그나 지도를 눌러 들어왔습니다. 요즘은 ChatGPT에 "성수동 수제 케이크 맛집 추천해 줘"라고 묻고, AI가 써 준 서너 줄 답변만 읽고 가게를 고르는 손님이 늘었습니다. 이 답변에 우리 가게 이름이 나오지 않으면 손님은 우리 가게를 후보로 떠올리지도 못합니다.
AI 답변 서비스는 출처를 달아 요약해 주는 기자와 비슷합니다. 기자는 여러 자료를 읽고 기사를 쓴 뒤 "무엇에 따르면"이라고 출처를 밝힙니다. 기자가 우리 가게 자료를 찾지 못하거나(크롤러가 막힘), 찾아도 무슨 가게인지 헷갈리거나(회사 정보가 흩어짐), 인용할 만한 문장이 없으면(질문에 답하는 문단이 없음) 기사에 우리 가게는 나오지 않습니다. GEO는 이 기자가 우리 사이트를 쉽게 찾고, 정확히 알아보고, 믿고 인용할 수 있게 자료를 정리해 두는 일입니다.
답변부터 읽는 사람들
OpenAI는 2026년 2월 27일 ChatGPT의 주간 활성 사용자가 9억 명을 넘었다고 밝혔습니다1. 국내에서도 네이버가 통합검색에 AI 브리핑을 붙였고, 2026년 5월에는 AI 브리핑에 인용된 횟수를 기준으로 블로그·카페 등의 창작자 약 3,000명을 매달 골라 공개하고 활동비를 지원하겠다고 발표했습니다2.
답변을 먼저 읽는 사람에게 회사 사이트가 닿으려면 답변 본문에 회사 이름이 나오거나, 답변 옆 출처 링크에 사이트 주소가 붙어야 합니다. 그래서 회사 입장에서는 검색 결과 몇 번째에 있느냐보다 답변이 그 사이트를 근거로 삼았느냐를 먼저 따져야 합니다.
SEO·AEO·GEO는 무엇이 다른가요?
세 용어는 같은 사이트를 보는 세 관점입니다. 한 문장씩 풀면 다음과 같습니다.
- 검색엔진 최적화(SEO, Search Engine Optimization): 구글·네이버 같은 검색엔진이 페이지를 찾아 읽고, 검색 결과 목록에 잘 보여 주게 하는 일입니다.
- 답변 엔진 최적화(AEO, Answer Engine Optimization): 검색 결과 위의 요약 답변이나 음성 비서가 우리 페이지의 문단을 그대로 떼어 답으로 쓰기 쉽게 만드는 일입니다.
- 생성형 AI 검색 최적화(GEO): ChatGPT처럼 여러 자료를 모아 새 답변을 쓰는 AI가 우리 회사를 알아보고 출처로 인용하게 하는 일입니다.
세 일은 겹치는 부분이 크지만, 주로 보는 곳은 조금씩 다릅니다. 표로 나란히 놓으면 이렇습니다.
| 구분 | 검색엔진 최적화(SEO) | 답변 엔진 최적화(AEO) | 생성형 AI 검색 최적화(GEO) |
|---|---|---|---|
| 묻는 질문 | 검색엔진이 페이지를 수집하고 이해해 결과 목록에 보여 줄 수 있는가 | 질문에 바로 답하는 문단을 떼어 가기 쉬운가 | 생성형 AI가 답변을 쓸 때 회사를 알아보고 출처로 인용할 근거가 있는가 |
| 결과가 나타나는 곳 | 검색 결과 목록 | 검색 결과 위 요약 답변, 음성 비서 답변 | ChatGPT·Gemini·Claude·Perplexity 답변, 구글 AI 개요와 AI 모드, 네이버 AI 브리핑 |
| 주로 손보는 것 | 수집 허용, 사이트맵, 제목·설명, 구조화 데이터 | 질문형 소제목, 제목 아래 답 문단, 목록·표 | AI 크롤러별 허용, 회사 정보 구조화 데이터, 근거와 출처, 답변 확인 |
| 성과를 보는 법 | 노출·클릭·순위 | 요약 답변 노출 | 답변 속 언급·인용 비율 |
표에 나온 사이트맵(sitemap)은 사이트에 어떤 페이지가 있는지 적어 둔 목록 파일이고, 구조화 데이터(structured data)는 아래 "회사 사이트가 준비할 항목"에서 풀이합니다.
구글은 이 구분을 따로 두지 않습니다. 2026년 5월 새로 낸 생성형 AI 기능 최적화 안내에서 "구글 검색의 관점에서 생성형 AI 검색을 위한 최적화는 검색 경험을 위한 최적화이고, 따라서 여전히 SEO"라고 적었습니다4. AI 개요와 AI 모드에 나타나는 데에도 추가 기술 요건이 없고, 페이지가 색인(indexing, 검색엔진이 페이지를 읽어 자기 목록에 등록해 두는 일)되어 스니펫(snippet, 검색 결과에서 제목 아래 보이는 짧은 본문 발췌)과 함께 검색에 나올 수 있으면 된다고 안내합니다5.
그래서 GEO의 기반은 SEO라고 보는 편이 정확합니다. 다만 구글 밖의 AI 서비스는 크롤러와 설정이 따로 있어서 SEO만으로 덮이지 않는 부분이 생깁니다. 이 부분은 아래 "학습 거부와 검색 노출" 절에서 다룹니다.
GEO라는 이름의 출처: 2023년 논문
GEO라는 말을 널리 알린 것은 2023년 11월 arXiv(아카이브, 연구자들이 논문을 심사 전에 먼저 공개하는 사이트)에 올라온 논문 「GEO: Generative Engine Optimization」입니다. 이 논문은 이듬해 데이터 분석 분야의 큰 국제 학회인 KDD 2024에서 발표됐습니다(Aggarwal 외)3. 연구진은 여러 출처를 모아 대규모 언어 모델(LLM, ChatGPT 같은 AI의 바탕이 되는 모델)로 답을 요약하는 검색을 "생성형 엔진(generative engine)"이라 부르고, 이런 엔진에서는 글을 만든 쪽이 자기 글이 언제 어떻게 쓰이는지 거의 통제하지 못한다는 문제를 짚었습니다.
연구진은 질문 1만 개를 놓고 원문을 아홉 가지 방식으로 고쳐 쓴 뒤, AI 답변 속에서 그 글이 얼마나 쓰였는지 쟀습니다. 결론은 세 줄로 요약됩니다.
- 출처 표기, 다른 사람 말 인용, 통계 수치를 더한 글이 답변에 가장 많이 쓰였습니다.
- 문장을 매끄럽게 다듬거나 쉬운 말로 고친 글도 효과가 있었습니다.
- 검색엔진 최적화에서 흔히 쓰던 키워드 반복은 효과가 거의 없었고, 실제 서비스에서는 오히려 손해였습니다.
논문 초록(abstract, 논문 첫머리에 연구 전체를 몇 문장으로 줄여 둔 요약)에 나오는 "답변 속 노출을 최대 40%(up to 40%) 높였다"는 수치는 이 실험 조건에서 나온 상한입니다. 모든 사이트에 평균 40%를 약속하는 숫자로 옮기면 원문과 달라집니다. 실험 방법과 방식별 수치는 글 끝 "개발자를 위한 심화" 절에 옮겨 두었습니다.
생성형 AI는 어떤 순서로 출처를 고르나요?
서비스마다 세부 구현은 공개되어 있지 않습니다. 공개 문서로 확인되는 큰 흐름은 네 단계입니다. 구글은 AI 개요와 AI 모드가 검색 색인에서 관련 페이지를 찾아 그 내용을 근거로 답을 만든다고 설명합니다. 이런 방식을 검색 증강 생성(RAG)이라 하고, 구글 문서는 grounding(근거 대기)이라고 부릅니다. 여기에 질문 하나를 여러 관련 질의로 나눠 동시에 검색하는 방식(query fan-out)도 씁니다4. 앞의 기자 비유로 말하면 자료를 먼저 찾아 읽고 기사를 쓰는 방식이고, 궁금한 점을 여러 갈래로 나눠 한꺼번에 취재하는 것과 같습니다.
flowchart TD
A["수집
크롤러가 페이지를 가져감"] --> B["검색
질문에 맞는 페이지와 문단을 찾음"]
B --> C["답변 작성
찾은 내용을 근거로 언어 모델이 답을 씀"]
C --> D["출처 표시
근거로 쓴 페이지 주소를 붙임"]
S["사이트가 손댈 수 있는 곳"] -.-> A
S -.-> B
- 수집. 각 서비스의 크롤러가 페이지를 가져갑니다. robots.txt(사이트가 크롤러에게 들어와도 되는 곳과 안 되는 곳을 적어 두는 안내 파일)에서 막혀 있거나, 방화벽(firewall, 서버 앞에서 수상한 접속을 걸러 내는 보안 장치)이 요청을 거절하거나, 본문이 자바스크립트(브라우저에서 돌아가며 화면을 나중에 채우는 프로그램)를 실행해야만 보이면 이 단계에서 빠집니다.
- 검색. 질문이 들어오면 자체 색인이나 검색엔진에서 관련 페이지를 찾고, 그 안에서 답에 쓸 내용을 고릅니다.
- 답변 작성. 언어 모델이 고른 내용을 근거로 답을 씁니다.
- 출처 표시. 근거로 쓴 페이지 주소를 답변 옆이나 아래에 붙입니다.
사이트가 손댈 수 있는 곳은 1단계와 2단계의 재료입니다. 크롤러가 들어올 수 있게 하고, 질문에 바로 답하는 문단을 두고, 그 문단이 누구의 말인지 분명히 합니다. 3단계와 4단계에서 무엇을 고를지는 각 AI 서비스가 정하므로 어떤 방법도 인용을 보장하지 못합니다.
회사 사이트가 준비할 항목
젠아이랩스(GenAI Labs)가 운영하는 진단 서비스 GenAI AEO는 이 준비 상태를 다섯 영역 19개 항목으로 나눠 확인합니다(진단 기준 2026.09.15-2 판)6. 영역과 배점, 영역마다 스스로 던져 볼 질문은 다음과 같습니다.
표에 나오는 용어 몇 가지를 먼저 풀겠습니다.
- 구조화 데이터(structured data): 사람이 읽는 본문과 별도로, 기계가 읽도록 "회사 이름은 무엇, 주소는 어디"처럼 정해진 칸에 채워 넣은 정보입니다.
- JSON-LD: 구조화 데이터를 페이지 안에 적는 가장 흔한 표기 형식입니다. 방문자 화면에는 보이지 않습니다.
- schema.org: 구조화 데이터에 쓰는 칸 이름(회사, 글, 상품, 주소 등)을 구글·마이크로소프트 등이 함께 정해 둔 공용 사전입니다.
- sameAs: "이 회사의 공식 인스타그램·유튜브·네이버 블로그는 여기"라고 공식 채널 주소를 묶어 적는 칸입니다. AI가 여러 곳의 정보를 같은 회사로 알아보게 돕습니다.
| 영역(100점 중 배점) | 확인 질문 |
|---|---|
| AI 크롤러 접근(20) | 페이지가 정상 응답하는가? robots.txt가 AI 크롤러를 막고 있지 않은가? robots.txt에 사이트맵 위치를 적었는가? |
| 구조화 데이터(25) | JSON-LD가 있는가? 문법 오류는 없는가? 회사·글·서비스처럼 그 페이지를 설명하는 종류(타입) 표시가 있는가? |
| 답변 구조(25) | 질문형 소제목이 있는가? 제목 바로 아래 문단이 질문에 곧바로 답하는가? 제목 단계와 목록·표가 정리되어 있는가? |
| 콘텐츠 깊이(15) | 본문 분량이 충분한가? 최종 수정일이 적혀 있는가? 외부 출처 링크가 있는가? |
| 기업 정보(15) | 회사명·주소·연락처가 구조화 데이터에 있는가? 공식 채널 연결(sameAs)이 있는가? 글쓴이 정보가 있는가? |
flowchart TD
subgraph SEO["SEO: 가져가고 이해할 수 있나"]
A1["AI 크롤러 접근 20"]
A2["구조화 데이터 25"]
end
subgraph AEO["AEO: 답을 떼어 가기 쉬운가"]
B1["답변 구조 25"]
B2["콘텐츠 깊이 15"]
end
subgraph GEO["GEO: 회사를 정확히 알아보나"]
C1["기업 정보 15"]
C2["AI 답변 확인
점수 밖, 언급·인용 비율"]
end
SEO --> AEO --> GEO
앞의 두 영역은 SEO와 거의 같고, 가운데 두 영역은 AEO가 주로 보는 곳이며, 마지막 영역이 GEO에서 특히 중요해집니다.
답변을 쓰는 AI는 여러 곳에서 모은 정보를 한 회사의 설명으로 묶습니다. 회사 이름과 주소, 공식 채널이 사이트 곳곳에 같은 값으로, 기계가 읽는 형태로 적혀 있으면 그 묶음이 틀릴 가능성이 줄어듭니다.
논문 실험에서 출처와 수치를 분명히 적은 글이 답변에 더 많이 쓰였습니다. 그래서 진단은 외부 출처 링크를 보고, 최종 수정일과 글쓴이 정보는 믿을 만한 글인지 가늠하는 신호로 삼습니다.
직접 할 수 있는 일과 맡길 일
브라우저만으로 확인할 수 있는 일과 개발 담당자나 호스팅 업체에 맡길 일을 나눴습니다.
직접 할 수 있는 일
- 브라우저 주소창에
우리사이트주소/robots.txt(예:www.example.co.kr/robots.txt)를 입력해 봅니다. 파일이 열리면Disallow: /처럼 사이트 전체를 막는 줄이 있는지, 그 위에 GPTBot·OAI-SearchBot 같은 AI 크롤러 이름이 적혀 있는지 봅니다. - 회사 소개·서비스 페이지의 소제목을 손님이 실제로 묻는 질문 형태("주차가 되나요?", "당일 주문이 되나요?")로 바꾸고, 그 바로 아래 첫 문단에 답을 먼저 씁니다.
- 글마다 최종 수정일과 글쓴이를 적고, 수치나 주장에는 출처 링크를 답니다.
- 회사명·주소·전화번호를 사이트 모든 곳에서 같은 표기로 맞춥니다.
개발 담당자나 호스팅 업체에 요청할 일
- "AI 검색 크롤러(OAI-SearchBot, Claude-SearchBot, PerplexityBot)가 robots.txt와 방화벽에서 막혀 있지 않은지 확인해 주세요."
- "회사 정보(Organization)와 공식 채널(sameAs)을 JSON-LD로 넣어 주세요."
- "본문이 자바스크립트 없이도 HTML(서버가 보내는 웹 페이지 원본 글)에 들어 있는지 확인해 주세요."
학습 거부와 검색 노출, 따로 설정하기
AI 서비스 운영사들은 크롤러를 용도에 따라 나눠 두었습니다. 하나는 AI 모델을 학습시킬 글을 모으는 크롤러이고, 다른 하나는 질문이 들어왔을 때 답변 근거를 찾아 출처로 보여 주는 크롤러입니다. 이 구분을 모르면 AI 학습에 쓰이는 것만 막으려다 AI 검색 답변에서도 빠지는 일이 생깁니다.
- OpenAI. GPTBot은 생성형 AI 기반 모델(여러 서비스의 바탕이 되는 큰 AI 모델) 학습에 쓸 수 있는 내용을 수집하고, OAI-SearchBot은 ChatGPT 검색 결과에 사이트를 보여 주는 데 씁니다. OpenAI는 두 설정이 서로 독립이라 OAI-SearchBot은 허용하고 GPTBot은 막을 수 있다고 안내합니다. OAI-SearchBot을 막은 사이트는 ChatGPT 검색 답변 본문에는 인용되지 않고, 사이트 이름을 찾는 질문에서 링크로만 나올 수 있습니다7.
- Anthropic. ClaudeBot은 학습에 쓰일 수 있는 웹 내용을 모으고, Claude-SearchBot은 검색 품질을 위해, Claude-User는 사용자 질문에 답하려고 페이지를 방문합니다. 세 크롤러 모두 robots.txt를 따르고, 이름별로 따로 막을 수 있습니다8.
- Perplexity. PerplexityBot은 검색 결과에 사이트를 보여 주고 링크하는 데 쓰며 기반 모델 학습에는 쓰지 않는다고 밝힙니다9.
- 구글. Google-Extended는 따로 요청을 보내는 크롤러가 없고 robots.txt에만 쓰는 제어용 이름입니다. 구글이 수집한 내용을 Gemini 모델 학습과 근거 활용에 쓸지를 정하고, 구글 검색 노출에는 영향을 주지 않습니다10. AI 개요·AI 모드에 보이는 내용은 기존 검색에서 "발췌를 보여 주지 말 것", "이 부분은 빼 줄 것", "이 길이까지만 보여 줄 것"을 지정하던 스니펫 제어 설정으로 관리합니다5.
robots.txt는 강제 자물쇠가 아니라 "이 크롤러는 들어오지 말아 달라"고 적어 두는 요청입니다. 이 파일에는 크롤러마다 자기 이름(user-agent, 크롤러가 방문할 때 밝히는 이름표)을 적은 묶음을 따로 만들 수 있어서, 학습용 크롤러(GPTBot, ClaudeBot)와 학습 제어용 이름 Google-Extended만 막고 검색용 크롤러는 들여보내는 식으로 나눠 쓸 수 있습니다. 실제 설정 예시는 글 끝 심화 절에 두었고, 크롤러별 설정과 흔한 실수는 robots.txt로 AI 크롤러 설정하기에서 자세히 다룹니다.
GEO를 둘러싼 흔한 오해
"llms.txt만 두면 된다." llms.txt는 사이트 개요와 주요 문서 링크를 마크다운(Markdown, #·- 같은 간단한 기호로 제목과 목록을 표시하는 글 형식)으로 적어 두자는 제안입니다. 2024년 9월 Jeremy Howard가 제안했고 2026년 8월 2판이 나왔습니다11. 구글은 llms.txt 같은 AI용 텍스트 파일이 구글 검색(생성형 AI 기능 포함)에 필요 없고, 두어도 구글 검색 노출에 도움도 손해도 되지 않는다고 적었습니다4. llms.txt는 크롤러 접근과 본문 구조를 대신하지 못합니다. GenAI AEO도 llms.txt 유무를 점수에 넣지 않습니다. 자세한 내용은 llms.txt란?에 정리했습니다.
"구조화 데이터를 넣으면 인용된다." 구조화 데이터는 페이지가 무엇을 말하는지 기계가 헷갈리지 않게 돕습니다. 인용 여부를 정하지는 않습니다. 구글은 생성형 AI 검색에 구조화 데이터가 필요하지 않고 특별한 schema.org 마크업도 없다고 밝혔습니다4. 리치 결과(rich results, 검색 결과에 별점·자주 묻는 질문·조리 순서 같은 부가 정보가 붙어 보이는 형태) 가운데 How-to는 2023년 9월에 없어졌습니다. FAQ는 2023년 8월부터 잘 알려진 정부·보건 사이트에만 보이도록 좁혀졌다가, 2026년 5월 7일부터는 구글 검색 결과에 아예 나오지 않습니다12. 특정 마크업이 특정 노출을 만든다는 설명은 날짜와 함께 확인해야 합니다.
"진단 점수가 높으면 반드시 인용된다." 점수는 AI가 사이트를 읽고 인용할 준비를 잰 값입니다. 내용이 질문에 맞는지, 다른 사이트보다 나은 근거인지는 점수가 말해 주지 않습니다. 인용은 각 AI 서비스가 고릅니다.
"글을 매일 많이 올리면 AI가 알아서 고른다." 구글 스팸 정책은 사용자에게 가치를 더하지 않은 채 생성형 AI 도구로 페이지를 대량으로 만드는 일을 "대규모 콘텐츠 악용"의 예로 듭니다13. 논문 실험에서도 효과를 낸 쪽은 반복보다 근거였습니다. 글 수보다 편마다 그 회사만 줄 수 있는 사실이 들어 있는지를 따져야 합니다.
국내 주요 사이트의 준비 상태
젠아이랩스는 국내 주요 사이트를 같은 기준으로 정기 관측합니다. 2026년 9월 17일 첫 관측에서 103곳을 봤고, 그중 점수가 나온 70곳의 AI 검색 준비도(GenAI AEO 진단 점수로 잰 값) 평균은 100점 만점에 42.0점이었습니다. 70곳 가운데 35곳이 40점 미만이었고 80점 이상은 1곳이었습니다. 같은 날, 같은 진단 프로그램과 기준으로 해외 주요 사이트 103곳을 쟀더니 점수가 나온 64곳의 평균은 57.0점이었습니다.
두 숫자 모두 누구나 받을 수 있는 무료 진단과 같은 조건(홈 포함 3페이지, 서버가 보낸 HTML만 분석)으로 잰 값이고, 차단·접속 실패로 점수가 나오지 않은 곳은 평균에서 뺐습니다. 측정 방법과 한계, 항목별 차이는 국내 주요 사이트 103곳 첫 관측에 있습니다.
무엇부터 시작하면 되나요?
- 현재 상태를 잽니다. 사이트 주소를 넣어 다섯 영역 점수와 기준에 못 미친 항목을 확인합니다.
- 영향이 큰 항목부터 고칩니다. 크롤러가 막혀 있으면 나머지를 고쳐도 소용이 없습니다. 그다음은 배점이 큰 구조화 데이터와 답변 구조입니다.
- 같은 기준으로 다시 잽니다. 고친 뒤 같은 조건으로 다시 진단해 항목이 통과했는지 봅니다.
- AI 답변을 반복해서 확인합니다. 고객이 실제로 물을 법한 질문을 AI 서비스마다 여러 번 묻고, 회사가 언급·인용되는 비율을 봅니다. 답변은 물을 때마다 달라지므로 한 번 본 결과로 판단하지 않습니다. 앞의 케이크 가게라면 "성수동 수제 케이크 맛집 추천해 줘", "성수동 당일 픽업 되는 케이크 가게"를 ChatGPT·Gemini·Perplexity에 각각 여러 번 물어 가게 이름이 몇 번 나오는지 적어 두면 됩니다.
젠아이랩스도 자사 사이트 gensapps.com에 이 순서를 먼저 적용했습니다. 2026년 9월 12일 첫 측정은 진단 대상 20페이지 기준 61.1점이었고, robots.txt 정리와 llms.txt 추가, 자주 묻는 질문과 FAQPage, 회사·서비스 구조화 데이터, 수정일 표기를 차례로 반영했습니다. 그 기록은 GenAI AEO 사례 절에 있습니다.
현재 점수는 측정 조건이 달라 따로 적습니다. 2026년 9월 16일 무료 진단(홈 포함 3페이지) 기준 85.8점입니다. 첫 측정은 진단 대상 20페이지를 잰 값이고 지금 점수는 홈을 포함한 3페이지만 잰 값입니다. 시험 범위가 다른 두 성적표라서 앞의 61.1점과 한 줄로 이어 읽을 수 없습니다. 이 점수에서도 제목 아래 답 문단, 질문형 소제목, sameAs가 남은 개선 항목으로 나옵니다.
위 순서의 첫 단계인 현재 상태 측정은 사이트 주소만 넣으면 됩니다. 1분 안팎이면 무료 진단 대상인 18개 항목의 결과가 나옵니다(전체 19개 항목 가운데 자바스크립트 실행 전후 비교 1개는 무료 진단에서 뺍니다). GenAI AEO 무료 진단 시작하기
어떤 사이트를 인용할지는 각 AI 서비스가 정합니다. 진단은 인용을 방해하는 기술 요인을 찾는 일이며 인용을 보장하지 않습니다.
개념을 잡은 다음에는 설정 예시를 모은 AI 검색 최적화 체크리스트로 넘어가면 됩니다.
개발자를 위한 심화
이 부분은 직접 구현하는 개발자를 위한 내용입니다.
GEO 논문의 실험 설계와 수치
실험 설계는 이렇습니다. 연구진은 아홉 개 데이터 출처에서 모은 질의 1만 개로 평가 세트 GEO-bench를 만들었습니다. 그다음 원문을 고쳐 쓰는 아홉 가지 방법(권위 있는 어조, 통계 추가, 키워드 반복, 출처 표기, 인용문 추가, 쉬운 말로 고치기, 문장 다듬기, 드문 단어 추가, 전문 용어 추가)을 적용하고, 답변 속에서 그 글이 얼마나 드러나는지 쟀습니다. 지표로는 답변에서 그 출처가 차지한 단어 수를 등장 위치로 가중한 값(Position-Adjusted Word Count)과, 언어 모델이 답변을 읽고 매긴 주관적 인상 점수(Subjective Impression)를 썼습니다. 답변을 쓰는 엔진은 연구진이 GPT-3.5 turbo로 만든 것이었습니다3.
- 출처 표기, 인용문 추가, 통계 추가가 가장 효과가 컸습니다. 위치 가중 단어 수 지표에서 30~40%, 주관적 인상 지표에서 15~30% 올랐습니다(기준 대비 상대 변화).
- 문장을 매끄럽게 다듬거나 쉬운 말로 고친 방법도 15~30% 올랐습니다.
- 검색엔진 최적화에서 흔히 쓰던 키워드 반복은 효과가 거의 없었습니다.
- 효과는 분야마다 달랐습니다. 검색 순위가 낮은 출처일수록 효과가 컸고, 이미 1위인 출처는 오히려 떨어진 경우도 있었습니다.
- 실제 서비스인 Perplexity에서 따로 확인했을 때는 인용문 추가가 위치 가중 단어 수 지표에서 22% 올라 가장 좋았고, 키워드 반복은 기준보다 10% 낮았습니다.
robots.txt로 학습용과 검색용 크롤러 나누기
아래는 학습용 크롤러(GPTBot, ClaudeBot)와 Google-Extended만 막고 나머지는 허용하는 robots.txt 예시입니다. 학습에는 쓰지 말되 검색 답변에는 나오고 싶다면 robots.txt를 이렇게 나눠 쓸 수 있습니다. 막는 규칙이 없는 크롤러는 모두 허용되므로 허용 규칙(Allow: /)은 따로 적지 않았습니다.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Sitemap: https://www.example.co.kr/sitemap.xml
크롤러는 자기 이름이 적힌 묶음이 있으면 그 묶음만 따르고 User-agent: * 묶음의 규칙을 함께 적용하지 않습니다(robots.txt 표준 문서 RFC 9309). 위 설정에서 GPTBot, ClaudeBot, Google-Extended는 각자 이름의 묶음을 따르고, OAI-SearchBot·Claude-SearchBot·PerplexityBot·Googlebot·네이버의 Yeti는 자기 이름의 묶음도 * 묶음도 없으니 제한 없이 허용됩니다. 사용자가 직접 요청해 방문하는 ChatGPT-User와 Perplexity-User에는 robots.txt가 적용되지 않을 수 있다고 두 운영사가 밝혔습니다79. Google-Extended 묶음은 Gemini 학습과 근거 활용만 막을 뿐, 구글 검색 노출과 순위에는 영향을 주지 않습니다10.
구글 AI 개요·AI 모드에 보이는 범위는 페이지 단위 nosnippet·max-snippet·noindex 메타 태그와, 요소 단위 data-nosnippet 속성으로 조정합니다5.
참고 자료
| 번호 | 자료 | 다루는 내용 | 발행처·날짜(확인일) |
|---|---|---|---|
| 1 | Scaling AI for everyone | ChatGPT 주간 활성 사용자 9억 명 이상 | OpenAI, 2026-02-27(2026-09-17) |
| 2 | AI 시대 네이버의 데이터·콘텐츠 전략 보도자료 | AI 브리핑 인용 수 기준 창작자 선정 | 네이버, 2026-05-28(2026-09-17) |
| 3 | GEO: Generative Engine Optimization | GEO 정의, GEO-bench, 방법별 효과 | Aggarwal 외, arXiv 2023-11-16(v3 2024-06-28), KDD 2024(2026-09-17) |
| 4 | Optimizing your website for generative AI features on Google Search | AEO·GEO를 보는 구글 입장, llms.txt, 구조화 데이터 | Google Search Central, 2026-07-10 갱신(2026-09-17) |
| 5 | AI features and your website | AI 개요·AI 모드 요건, 스니펫 제어 | Google Search Central, 2025-12-10 갱신(2026-09-17) |
| 6 | GenAI AEO 진단 기준 | 5개 영역 19개 항목과 배점 | GenAI Labs, 기준 2026.09.15-2 판(2026-09-17) |
| 7 | Overview of OpenAI Crawlers | GPTBot, OAI-SearchBot, ChatGPT-User | OpenAI(2026-09-17) |
| 8 | Does Anthropic crawl data from the web | ClaudeBot, Claude-SearchBot, Claude-User | Anthropic(2026-09-17) |
| 9 | Perplexity Crawlers | PerplexityBot, Perplexity-User | Perplexity(2026-09-17) |
| 10 | Google's common crawlers: Google-Extended | Google-Extended의 성격과 영향 범위 | Google, 2026-07-14 갱신(2026-09-17) |
| 11 | The /llms.txt file, v2 | llms.txt 제안과 형식 | Jeremy Howard, 2024-09-03 제안, 2026-08-10 수정(2026-09-17) |
| 12 | Search Central documentation updates | How-to(2023-09)·FAQ(2026-05) 리치 결과 종료 | Google Search Central(2026-09-17) |
| 13 | Spam policies for Google web search | 대규모 콘텐츠 악용 | Google Search Central, 2026-08-28 갱신(2026-09-17) |
글쓴이 박수현(젠아이랩스 대표) with AI (Claude Opus 5). 이 글에서 소개한 진단 서비스 GenAI AEO를 운영하는 회사의 대표이고, 『바이브 코딩의 시대, 프롬프트를 넘어 컨텍스트 엔지니어링으로』, 『바이브 코딩 시대의 공학적 연구 방법론』 등 AI 실무서 네 권을 썼습니다.