전 세계 웹 트래픽의 상당 부분이 지나가는 클라우드플레어가 7월 1일 크롤러 접근 규칙을 새로 정했다. 크롤러를 "검색용", "AI 학습용", "AI 에이전트용" 세 종류로 나누고, 9월 15일부터는 광고가 붙은 페이지에서 학습·에이전트 크롤러를 기본적으로 차단한다. 검색용 크롤러만 그대로 열어둔다. 이 기본값은 무료 이용자, 신규 가입자, 기존 이용자가 새로 만드는 사이트에 자동으로 적용된다. 아무것도 안 하면 9월 15일에 그냥 이 설정으로 바뀐다는 뜻이다.
왜 지금 이게 이야기가 되나
발표는 두 달 전이었지만, 실제로 스위치가 눌리는 날은 2주 뒤다. 그래서 이번 주 들어 "지금 바로 뭘 확인해야 하는지" 정리하는 기사가 다시 늘고 있다. 그리고 이 정책에는 처음 보면 지나치기 쉬운 함정이 하나 있다 — 구글봇처럼 검색과 AI 학습을 같이 하는 "혼합형" 크롤러는, 학습 크롤러를 막는 순간 검색 크롤러 허용 여부와 무관하게 같이 막힐 수 있다. 검색 유입을 지키려다 검색 크롤러까지 잃는 역설이 생길 수 있다는 뜻이다.
원리 — 크롤러를 막는 것과 인용을 막는 것은 다른 결정이다
이 정책이 구분하는 건 "누가 내 글을 가져가는가"가 아니라 "가져가서 뭘 하는가"다. 검색 크롤러는 내 페이지를 색인해서 검색 노출검색 노출은 검색 결과 화면에 내 페이지가 표시된 횟수다. 사람이 클릭했는지와는 무관하게, 화면에 뜨기만 해도 1회로 센다. 노출은 있는데 클릭이 0이라면 대개 순위가 너무 낮아서 아무도 거기까지 안 내려간 것이다. 로 이어주고, 학습 크롤러는 AI 모델을 훈련시키는 데 쓰고, 에이전트 크롤러는 챗GPT나 퍼플렉시티 같은 AI가 답변을 만들 때 실시간으로 내 페이지를 읽어간다. 셋을 뭉뚱그려 "AI는 다 막아야 안전하다"고 판단하면, AI 검색 답변에 내 콘텐츠가 인용될 기회까지 같이 닫아버리게 된다. 반대로 다 열어두면 학습 데이터로만 쓰이고 아무 보상도 없이 끝날 수도 있다. 이건 켜고 끄는 문제가 아니라 셋 중 뭘 원하는지 정하는 문제다.
확실한 것과 아닌 것 — 이 새 기본값은 클라우드플레어의 프록시(주황 구름)를 켜둔 사이트에만 적용된다. Vercel·Netlify처럼 클라우드플레어를 거치지 않는 호스팅을 쓰는 사이트는 대상이 아니다(다만 자기 사이트가 클라우드플레어를 쓰는지 모르는 운영자가 꽤 있다). 기존 유료 요금제 이용자가 완전히 예외인지는 보도마다 표현이 조금씩 달라 명확한 공식 문구를 못 찾았다 — "새 사이트·무료 이용자"가 핵심 대상이라는 점만 여러 매체가 일치한다. 차단 후 실제로 AI 검색 인용이 얼마나 줄거나 느는지는 아직 아무도 측정하지 못했다(시행 전이라 데이터 자체가 없다).
주 방문자 100명 규모에서는
오늘 할 일은 하나다. 내 사이트가 클라우드플레어를 거치는지부터 확인한다 (호스팅·도메인 대행사 설정 화면에서 "Cloudflare" 표시나 DNS의 주황 구름 아이콘을 찾으면 된다). 거친다면 9월 15일 전에 대시보드의 보안 설정에 들어가 세 크롤러 중 뭘 열어둘지 직접 정한다. 이 사이트처럼 AI 검색 답변에 인용되는 것 자체가 목표라면 에이전트 크롤러는 열어두는 쪽이 유리하고, 학습 크롤러는 따로 판단할 문제다. 노출 자체가 워낙 적은 초기 사이트일수록, 정책 설계자가 아니라 기본값이 내 콘텐츠의 운명을 정하게 두지 않는 것이 이번 결정의 전부다.