3. 검색 시그널 (검색 신호)
검색 시그널은 AI 시스템이 여러분의 콘텐츠를 발견하고 접근할 수 있게 하는 지표와 메커니즘입니다. 전통적인 크롤링 가능성과 최신 AI 전용 발견 방법을 모두 포함합니다.
왜 중요한가
섹션 제목: “왜 중요한가”아무리 명확하고 잘 구조화된 콘텐츠라도 AI 시스템이 찾을 수 없다면 무용지물입니다. LLM이 RAG(Retrieval-Augmented Generation), 웹 브라우징, 도구 사용을 점점 더 활용함에 따라, 콘텐츠는 여러 채널을 통해 발견 가능해야 합니다.
구현 방법
섹션 제목: “구현 방법”1. 기본적인 크롤링 가능성 확보
섹션 제목: “1. 기본적인 크롤링 가능성 확보”- AI 크롤러를 허용하는 최신
robots.txt유지 sitemap.xml생성 및 제출- 가능하면 JavaScript 없이 페이지가 로드되도록 보장 (SSG/SSR)
2. llms.txt 표준 구현
섹션 제목: “2. llms.txt 표준 구현”사이트의 간결한 요약, 주요 페이지, 콘텐츠 탐색 방법을 제공하는 /llms.txt 파일을 생성하세요. 이것은 사이트의 “소개” 페이지에 해당하는 AI 버전입니다.
llms.txt의 5가지 안티패턴 피하기
섹션 제목: “llms.txt의 5가지 안티패턴 피하기”llms.txt는 품질 경쟁에서 지는 동안 채택 경쟁에서 이기고 있습니다 (2026년 3월 SE Ranking의 30만 도메인 연구에서 약 10% 채택률 발견). 주요 AI 랩, 인프라 기업, 개발 도구의 30개 llms.txt 파일을 감사한 결과, 30개 중 24개가 다섯 가지 반복적인 문제 중 하나 이상을 가지고 있었습니다:
- 모두 쏟아넣기 — llms.txt를 수백 개의 플랫 링크가 있는 두 번째 sitemap으로 취급하는 것. LLM이 실제 질문에 답할 예산을 남기면서 전체 파일을 컨텍스트 창 안에 읽을 수 없다면, 파일은 문제를 해결한 것이 아니라 이동시킨 것입니다. 수정: 링크 10~20개; 나머지는
## Optional아래에 두거나 sitemap.xml에 남깁니다. - robots.txt와 모순 — llms.txt를 읽는 바로 그 크롤러에게 robots.txt가 명시적으로
Disallow한 URL을 나열하는 것. 크롤러는 robots.txt를 따르므로, llms.txt는 장식이 됩니다. 수정: 두 파일을 함께 검토하세요. - HTML 링크만, .md 없음 — 크롤러가 깨끗하게 파싱할 수 없는 HTML 페이지를 가리키는 것(아래의 모든 페이지에 .md 트윈 제공 참조). 감사에서 30개 사이트 중 6개만이
.md동반 파일을 제공했습니다. 이것이 노력 대비 결과 차이가 가장 큰 안티패턴입니다. - 소개 페이지 연극 — 파일을 미션 선언문과 창업자 인용문에 쏟아붓고 하단에 링크 두 개만 남기는 것. LLM은 브랜드 서사가 아닌 콘텐츠로의 포인터가 필요합니다. H1 + 블록쿼트 요약이 “이 사이트는 무엇인가”의 자리이고, 그 아래는 구체적인 링크여야 합니다.
- 출시 시점에 동결 — 404 링크, 이름이 바뀐 제품, 출시 이후 건드리지 않은 파일. llms.txt는 문서처럼 수동으로 큐레이션하지만 오래된 README처럼 썩습니다. 자동화로 수정하세요: 나열된 URL의 404를 플래그하는 CI 검사, 그리고 추천 섹션의 분기별 재생성.
출시 전 감사, 다섯 가지 질문:
- 10KB 미만이고 20개 링크 미만인가(
## Optional제외)? - 나열된 모든 URL이 GPTBot과 ClaudeBot에 대해 robots.txt를 통과하는가?
- 상위 5개 URL 중 적어도 5개가
.md동반 파일을 가지고 있는가? - 본문이 마케팅 카피가 아닌 특정 페이지로 링크하는가?
- 지난 90일 이내에 업데이트되었는가?
3. 기계 판독 가능한 엔드포인트 제공
섹션 제목: “3. 기계 판독 가능한 엔드포인트 제공”AI 시스템이 쉽게 소비할 수 있는 형식으로 콘텐츠를 제공하세요:
모든 페이지에 .md 트윈 제공
섹션 제목: “모든 페이지에 .md 트윈 제공”“Markdown 버전” 항목의 가장 강력한 형태는 완전한 트윈입니다. 모든 콘텐츠 페이지가 .md를 붙여도 접근 가능하며, 동일한 콘텐츠를 깨끗한 Markdown으로 반환합니다.
/company → 사람을 위한 HTML/company.md → 기계를 위한 Markdown이것은 llms.txt 아이디어 — 에이전트에게 파싱해야 할 레이아웃 대신 Markdown을 제공하는 것 — 를 하나의 요약 파일에서 모든 페이지로 확장합니다. Anthropic 자체 문서도 이 패턴을 제공합니다: docs.claude.com 페이지에 .md를 붙이면 소스 Markdown을 얻을 수 있습니다.
llms.txt와 중복이 아닌 보완이 되는 이유:
llms.txt는 자체 선언적 요약이며, 검색 엔진은 이를 공개적으로 할인했습니다 — Google은 키워드 메타 태그에 비유하며 해당 파일을 지원하지 않는다고 확인했습니다..md트윈은 콘텐츠에 대한 주장이 아닙니다; 에이전트가 필요할 때 라이브로 가져오는 콘텐츠 자체입니다./page.md를 가져오는 에이전트는/page에서 내비게이션, 쿠키 배너, 사이드바 마크업을 걷어내는 에이전트보다 확실히 더 깨끗한 입력을 받습니다.
구현 요구사항:
Content-Type: text/markdown; charset=utf-8로 제공하세요 —text/plain은 안 됩니다. 방금 만든 구조적 시그널이 버려집니다.- 크롤러가 URL 체계를 추측하지 않고 발견할 수 있도록
Link: <…/page.md>; rel="alternate"; type="text/markdown"헤더로 트윈을 알려주세요. - 배포 후
curl -I https://yoursite.com/page.md로 확인하세요. GitHub Pages는 특히.md파일을 Jekyll을 통해 실행하여 조용히 렌더링된 HTML을 반환합니다 — 바로 트윈이 막으려던 실패입니다. llms.txt에서 트윈을 링크하여 요약 파일에서 페이지별 Markdown으로의 발견 경로가 있도록 하세요.
사이트 전체에 적용하기 전에 가장 많이 인용된 5개 페이지부터 시작하세요.
- 주요 페이지의 Markdown 버전
- 구조화 데이터용 API 엔드포인트
- 업데이트를 위한 RSS/Atom 피드
4. AI 검색 엔진 최적화
섹션 제목: “4. AI 검색 엔진 최적화”Perplexity, SearchGPT, Google AI Overviews 같은 AI 기반 검색 도구의 각 가이드라인을 따라 콘텐츠가 노출되도록 하세요.
5. 플랫폼 간 상호 참조
섹션 제목: “5. 플랫폼 간 상호 참조”여러 플랫폼(웹사이트, GitHub, LinkedIn 등)에 일관된 정보를 게시하여 AI 시스템이 여러 출처에서 콘텐츠를 삼각 검증하고 확인할 수 있도록 하세요.
최소 검색 설정:
/robots.txt — 크롤러 허용/sitemap.xml — 모든 페이지 목록/llms.txt — AI 전용 요약/feed.xml — RSS 피드고급 검색 설정:
/api/info.json — 구조화 데이터 엔드포인트/docs/overview.md — 문서의 Markdown 버전체크리스트
섹션 제목: “체크리스트”- robots.txt가 주요 AI 크롤러를 허용하는가(GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot)
- sitemap.xml이 생성되어 최신 상태인가(비콘텐츠 페이지 필터링 포함)
- llms.txt 파일이 정확한 사이트 요약과 함께 존재하는가
- llms.txt가 5가지 질문 감사를 통과하는가(≤20 링크, robots.txt 일관성,
.md동반 파일, 특정 링크, 90일 이내 업데이트) - 주요 콘텐츠가 JavaScript 없이 이용 가능한가
- 고가치 페이지에
text/markdown; charset=utf-8로 제공되는.md트윈이 있는가(curl -I로 확인) -
.md트윈이llms.txt에서 링크되고Link: rel="alternate"헤더로 알려지는가 - 상호 참조를 위해 콘텐츠가 여러 플랫폼에 게시되어 있는가