지난 2년 사이 "AI 검색에 잘 뜨려면 사이트 루트에 llms.txt라는 파일을 만들어야
한다"는 조언을 여러 곳에서 봤을 것이다. 사이트 소개와 주요 페이지 목록을 정리해
AI가 참고하게 만든다는 취지의 파일이다. 지금까지는 "만들면 좋다더라"는 말뿐이었고,
실제로 웹에 깔린 파일들이 어떤 상태인지 대규모로 들여다본 사람은 없었다.
9월 8일, 웹 크롤링 데이터를 모아 공개해온 비영리단체 커먼크롤이 그 일을 했다. 자기네가 수집한 전체 웹에서 llms.txt 파일 584,107개를 찾아 안을 열어봤다.
열어보니 이랬다
결과는 이렇다. 68%는 워드프레스 플러그인 같은 도구가 자동으로 찍어낸 템플릿이었고, 그중 41%는 위즈(Wix)가 생성한 것이었다. 22%는 링크가 단 하나도 없었다 — "주요 페이지 목록"이라는 이 파일의 원래 목적 자체가 비어 있는 셈이다. 6%는 속도 제한이나 저작권 고지 같은 "크롤러 사용 지침"을 적어 넣었는데, 그중 32개 파일은 한술 더 떠 커먼크롤 봇 자체를 "차단한다"고 명시했다. 그런데 정작 그 사이트들의 robots.txt(크롤러 차단을 실제로 강제하는 표준 파일)에는 그런 차단 규칙이 없었다. llms.txt에 뭐라고 적든, 실제로 크롤러를 막거나 허용하는 효력은 없다는 뜻이다. 심지어 파일 10개에서는 AI에게 특정 답변을 하도록 유도하는 문구 (프롬프트 주입 의심)까지 발견됐다.
반면 소수지만 다르게 쓴 사례도 있었다 — All in One SEO 플러그인이 만든 파일은 중앙값 138개 링크로 사이트맵에 가깝게 활용되고 있었다.
원리 — 이 파일은 허가증도 자물쇠도 아니다
llms.txt는 표준이 아니라 누구나 자유롭게 무시해도 되는 제안이다. 이 파일에 "이 페이지는 AI가 쓰지 마세요"라고 적어도 지켜야 할 크롤러는 없다. 실제로 어떤 AI 서비스도 "우리는 llms.txt를 읽는다"고 공식적으로 밝힌 적이 없다. 접근을 막고 싶으면 크롤러가 실제로 지키는 robots.txt에 써야 하고, 뭔가를 보여주고 싶으면 그냥 사이트 콘텐츠 자체를 명확하게 쓰는 수밖에 없다. llms.txt는 그 사이 어디쯤 있는, 강제력 없는 "참고 메모"에 가깝다.
확실한 것과 아닌 것 — 위 수치는 커먼크롤이 직접 공개한 분석(9월 8일 기준)을 Search Engine Journal 보도로 확인한 것이다. 이번 확인 시점에 커먼크롤의 원본 리포트 페이지(Hugging Face)는 접속이 막혀 직접 열람하지는 못했다. 반면 "llms.txt가 실제로 AI 검색 인용 빈도에 영향을 주는지"는 이번 분석이 다루는 범위가 아니다 — 이 분석은 "무엇이 적혀 있는가"만 확인했을 뿐, "그게 효과가 있는가"는 별개 질문으로 남는다.
주 방문자 100명 규모에서는
이 파일을 만드는 데 저녁 시간을 쓸 필요는 없다. 만들어도 크롤러가 읽는다는 보장이 없고, 안 만들었다고 손해 볼 일도 없다. 그 시간에 실제로 AI가 인용할 콘텐츠 — 구체적인 숫자와 사례가 든 글 — 를 한 편 더 쓰는 게 낫다. 굳이 만든다면 "AI용 특수 파일"이 아니라 "사람도 읽을 수 있는 사이트 요약 한 페이지"라고 생각하고 짧게 쓰면 된다. 크롤러 접근을 통제하고 싶다면 그 일은 이 파일이 아니라 robots.txt의 몫이라는 것만 기억해두자.