콘텐츠로 이동

3. 검색 시그널 (검색 신호)

검색 시그널은 AI 시스템이 여러분의 콘텐츠를 발견하고 접근할 수 있게 하는 지표와 메커니즘입니다. 전통적인 크롤링 가능성과 최신 AI 전용 발견 방법을 모두 포함합니다.

아무리 명확하고 잘 구조화된 콘텐츠라도 AI 시스템이 찾을 수 없다면 무용지물입니다. LLM이 RAG(Retrieval-Augmented Generation), 웹 브라우징, 도구 사용을 점점 더 활용함에 따라, 콘텐츠는 여러 채널을 통해 발견 가능해야 합니다.

1. 기본적인 크롤링 가능성 확보

섹션 제목: “1. 기본적인 크롤링 가능성 확보”
  • AI 크롤러를 허용하는 최신 robots.txt 유지
  • sitemap.xml 생성 및 제출
  • 가능하면 JavaScript 없이 페이지가 로드되도록 보장 (SSG/SSR)

사이트의 간결한 요약, 주요 페이지, 콘텐츠 탐색 방법을 제공하는 /llms.txt 파일을 생성하세요. 이것은 사이트의 “소개” 페이지에 해당하는 AI 버전입니다.

llms.txt의 5가지 안티패턴 피하기

섹션 제목: “llms.txt의 5가지 안티패턴 피하기”

llms.txt는 품질 경쟁에서 지는 동안 채택 경쟁에서 이기고 있습니다 (2026년 3월 SE Ranking의 30만 도메인 연구에서 약 10% 채택률 발견). 주요 AI 랩, 인프라 기업, 개발 도구의 30개 llms.txt 파일을 감사한 결과, 30개 중 24개가 다섯 가지 반복적인 문제 중 하나 이상을 가지고 있었습니다:

  1. 모두 쏟아넣기 — llms.txt를 수백 개의 플랫 링크가 있는 두 번째 sitemap으로 취급하는 것. LLM이 실제 질문에 답할 예산을 남기면서 전체 파일을 컨텍스트 창 안에 읽을 수 없다면, 파일은 문제를 해결한 것이 아니라 이동시킨 것입니다. 수정: 링크 10~20개; 나머지는 ## Optional 아래에 두거나 sitemap.xml에 남깁니다.
  2. robots.txt와 모순 — llms.txt를 읽는 바로 그 크롤러에게 robots.txt가 명시적으로 Disallow한 URL을 나열하는 것. 크롤러는 robots.txt를 따르므로, llms.txt는 장식이 됩니다. 수정: 두 파일을 함께 검토하세요.
  3. HTML 링크만, .md 없음 — 크롤러가 깨끗하게 파싱할 수 없는 HTML 페이지를 가리키는 것(아래의 모든 페이지에 .md 트윈 제공 참조). 감사에서 30개 사이트 중 6개만이 .md 동반 파일을 제공했습니다. 이것이 노력 대비 결과 차이가 가장 큰 안티패턴입니다.
  4. 소개 페이지 연극 — 파일을 미션 선언문과 창업자 인용문에 쏟아붓고 하단에 링크 두 개만 남기는 것. LLM은 브랜드 서사가 아닌 콘텐츠로의 포인터가 필요합니다. H1 + 블록쿼트 요약이 “이 사이트는 무엇인가”의 자리이고, 그 아래는 구체적인 링크여야 합니다.
  5. 출시 시점에 동결 — 404 링크, 이름이 바뀐 제품, 출시 이후 건드리지 않은 파일. llms.txt는 문서처럼 수동으로 큐레이션하지만 오래된 README처럼 썩습니다. 자동화로 수정하세요: 나열된 URL의 404를 플래그하는 CI 검사, 그리고 추천 섹션의 분기별 재생성.

출시 전 감사, 다섯 가지 질문:

  1. 10KB 미만이고 20개 링크 미만인가(## Optional 제외)?
  2. 나열된 모든 URL이 GPTBot과 ClaudeBot에 대해 robots.txt를 통과하는가?
  3. 상위 5개 URL 중 적어도 5개가 .md 동반 파일을 가지고 있는가?
  4. 본문이 마케팅 카피가 아닌 특정 페이지로 링크하는가?
  5. 지난 90일 이내에 업데이트되었는가?

3. 기계 판독 가능한 엔드포인트 제공

섹션 제목: “3. 기계 판독 가능한 엔드포인트 제공”

AI 시스템이 쉽게 소비할 수 있는 형식으로 콘텐츠를 제공하세요:

“Markdown 버전” 항목의 가장 강력한 형태는 완전한 트윈입니다. 모든 콘텐츠 페이지가 .md를 붙여도 접근 가능하며, 동일한 콘텐츠를 깨끗한 Markdown으로 반환합니다.

/company → 사람을 위한 HTML
/company.md → 기계를 위한 Markdown

이것은 llms.txt 아이디어 — 에이전트에게 파싱해야 할 레이아웃 대신 Markdown을 제공하는 것 — 를 하나의 요약 파일에서 모든 페이지로 확장합니다. Anthropic 자체 문서도 이 패턴을 제공합니다: docs.claude.com 페이지에 .md를 붙이면 소스 Markdown을 얻을 수 있습니다.

llms.txt와 중복이 아닌 보완이 되는 이유:

  • llms.txt는 자체 선언적 요약이며, 검색 엔진은 이를 공개적으로 할인했습니다 — Google은 키워드 메타 태그에 비유하며 해당 파일을 지원하지 않는다고 확인했습니다. .md 트윈은 콘텐츠에 대한 주장이 아닙니다; 에이전트가 필요할 때 라이브로 가져오는 콘텐츠 자체입니다.
  • /page.md를 가져오는 에이전트는 /page에서 내비게이션, 쿠키 배너, 사이드바 마크업을 걷어내는 에이전트보다 확실히 더 깨끗한 입력을 받습니다.

구현 요구사항:

  1. Content-Type: text/markdown; charset=utf-8로 제공하세요 — text/plain안 됩니다. 방금 만든 구조적 시그널이 버려집니다.
  2. 크롤러가 URL 체계를 추측하지 않고 발견할 수 있도록 Link: <…/page.md>; rel="alternate"; type="text/markdown" 헤더로 트윈을 알려주세요.
  3. 배포 후 curl -I https://yoursite.com/page.md로 확인하세요. GitHub Pages는 특히 .md 파일을 Jekyll을 통해 실행하여 조용히 렌더링된 HTML을 반환합니다 — 바로 트윈이 막으려던 실패입니다.
  4. llms.txt에서 트윈을 링크하여 요약 파일에서 페이지별 Markdown으로의 발견 경로가 있도록 하세요.

사이트 전체에 적용하기 전에 가장 많이 인용된 5개 페이지부터 시작하세요.

  • 주요 페이지의 Markdown 버전
  • 구조화 데이터용 API 엔드포인트
  • 업데이트를 위한 RSS/Atom 피드

Perplexity, SearchGPT, Google AI Overviews 같은 AI 기반 검색 도구의 각 가이드라인을 따라 콘텐츠가 노출되도록 하세요.

여러 플랫폼(웹사이트, GitHub, LinkedIn 등)에 일관된 정보를 게시하여 AI 시스템이 여러 출처에서 콘텐츠를 삼각 검증하고 확인할 수 있도록 하세요.

최소 검색 설정:

/robots.txt — 크롤러 허용
/sitemap.xml — 모든 페이지 목록
/llms.txt — AI 전용 요약
/feed.xml — RSS 피드

고급 검색 설정:

/api/info.json — 구조화 데이터 엔드포인트
/docs/overview.md — 문서의 Markdown 버전
  • robots.txt가 주요 AI 크롤러를 허용하는가(GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot)
  • sitemap.xml이 생성되어 최신 상태인가(비콘텐츠 페이지 필터링 포함)
  • llms.txt 파일이 정확한 사이트 요약과 함께 존재하는가
  • llms.txt가 5가지 질문 감사를 통과하는가(≤20 링크, robots.txt 일관성, .md 동반 파일, 특정 링크, 90일 이내 업데이트)
  • 주요 콘텐츠가 JavaScript 없이 이용 가능한가
  • 고가치 페이지에 text/markdown; charset=utf-8로 제공되는 .md 트윈이 있는가(curl -I로 확인)
  • .md 트윈이 llms.txt에서 링크되고 Link: rel="alternate" 헤더로 알려지는가
  • 상호 참조를 위해 콘텐츠가 여러 플랫폼에 게시되어 있는가