한국 웹사이트 906곳의 AI 크롤러 정책 조사 — GPTBot을 막은 곳은 21.6%

한국 웹은 AI 크롤러에게 문을 열어 두었을까요? 사이트 1,133곳의 robots.txt·llms.txt·홈페이지를 직접 받아 봤어요. 막는 곳은 생각보다 적었고, 막는 방식은 업종마다 뚜렷하게 달랐어요. 그리고 robots.txt보다 더 큰 벽이 따로 있었어요.

저자
BaRam 리서치
공개
2026년 10월 2일 · 14분 읽기
데이터
2026-10-02 측정 · 분석 906곳 (Tranco 목록 Y83YG의 .kr 상위 1,000곳 + 주요 사이트) · 사이트별 원자료 공개

초록

AI 검색이 정보를 찾는 주요 경로가 되면서, 웹사이트가 AI 크롤러를 들일지 말지는 노출과 저작권 사이의 선택이 됐어요. 해외에는 이를 추적한 연구가 있지만 한국 웹을 다룬 공개 자료는 찾기 어려웠어요. 저희는 공개 순위 목록 Tranco에서 한국 도메인 상위 1,000곳과 주요 포털·커머스·언론·금융·대기업 사이트를 골라 1,133곳을 측정했고, 홈페이지가 정상으로 열린 906곳을 분석했어요.

AI 봇 16종 가운데 하나라도 막은 사이트는 25.8%였고, 검색엔진까지 막은 곳을 빼면 17.7%였어요. 가장 많이 막힌 봇은 OpenAI의 학습용 GPTBot(21.6%)이었고, 학습용 봇이 검색·실시간 조회용 봇보다 평균 5%p 더 많이 막혀 있었어요. 언론사는 47.5%가 학습용만 막고 검색용은 열어 두는 "분리 정책"을 쓰고 있었어요.

더 큰 장벽은 robots.txt 밖에 있었어요. 홈페이지가 스크립트로만 다른 주소로 넘기거나 빈 껍데기라서, 스크립트를 실행하지 않는 크롤러가 아무것도 읽지 못하는 사이트가 18.3%였고, 정부·공공은 43.1%, 금융은 50%였어요. llms.txt를 둔 곳은 5.6%였지만 대기업 브랜드는 18.8%였어요.

주제어 · AI 크롤러 · robots.txt · GPTBot · llms.txt · 생성형 엔진 최적화(GEO) · 한국 웹

핵심 발견

  1. 74.2%

    발견 1. AI 봇 16종을 하나도 막지 않은 사이트. 네 곳 중 세 곳은 AI에게 완전히 열려 있어요.

  2. 21.6%

    발견 2. GPTBot을 막은 사이트. 같은 회사의 검색용 OAI-SearchBot은 13.7%만 막혀 있어요.

  3. 47.5%

    발견 3. 학습용 AI만 막고 검색용은 열어 둔 언론사. 학습은 거부하되 AI 답변에는 나오겠다는 선택이에요.

  4. 43.1%

    발견 4. 홈페이지가 크롤러에게 막다른 길인 정부·공공 사이트. robots.txt와 상관없이 AI가 읽을 게 없어요.

1.서론

ChatGPT·Gemini·Perplexity 같은 AI 검색은 답을 만들 때 웹 문서를 읽어 와요. 그래서 내 사이트가 AI 답변에 나오려면 먼저 AI 회사의 크롤러가 들어와 읽을 수 있어야 해요. 반대로 콘텐츠가 동의 없이 AI 학습에 쓰이는 걸 원하지 않는 곳은 크롤러를 막아요. 이 둘 사이에서 웹사이트가 의사를 밝히는 거의 유일한 수단이 robots.txt예요.

해외에서는 이 변화가 빠르게 기록되고 있어요. 대규모 학습 데이터셋의 출처 도메인을 추적한 연구는 2023~2024년 1년 사이 핵심 출처의 상당수가 robots.txt로 AI 수집을 막았다고 보고했어요(Longpre 외, 2024). 하지만 한국 웹사이트가 어떤 선택을 하고 있는지는 공개된 조사가 거의 없었어요.

그래서 세 가지를 물었어요.

  • 얼마나 막고 있나. AI 봇 16종 각각에 대해, 일반 본문 페이지를 막아 둔 비율은 얼마인가.
  • 어떻게 막고 있나. 학습용과 검색용을 가려서 막는가, 업종마다 다른가.
  • 열어 둔 곳은 정말 읽히나. robots.txt 밖에서 AI가 읽지 못하게 만드는 요인은 없는가.

2.데이터와 방법

2.1 표본

웹사이트 순위 연구에 널리 쓰이는 Tranco 목록(목록 ID Y83YG, 상위 100만 곳)에서 .kr로 끝나는 도메인 상위 1,000곳을 뽑았어요. 여기에 .kr을 쓰지 않는 주요 한국 사이트(포털·플랫폼, 커머스, 언론, 금융, 대기업·브랜드)를 사람이 직접 골라 더했어요. 중복을 빼면 1,133곳이에요.

Tranco에는 광고·CDN처럼 사람이 보는 사이트가 아닌 도메인도 섞여 있어요. 그래서 홈페이지가 정상 응답(2xx·3xx)을 준 906곳만 분석했어요. 접속되지 않은 163곳, 우리 측정 요청을 방화벽에서 거절한 42곳은 뺐어요(3.6절).

2.2 측정

2026-10-02 하루에 사이트마다 공개 주소 세 개만 요청했어요. /robots.txt, /llms.txt, 그리고 홈페이지예요. 요청에는 우리를 밝히는 이름(BaRamResearch)과 연락 주소를 실었고, 다른 회사의 봇 이름을 흉내 내지 않았어요. 로그인이나 우회는 하지 않았어요.

2.3 판정 규칙

robots.txt는 표준 문서 RFC 9309의 규칙대로 해석했어요. 봇 이름이 적힌 묶음이 있으면 그것만, 없으면 모든 봇(*) 묶음을 따르고, 같은 경로에 규칙이 겹치면 가장 구체적인 규칙이 이겨요. 파일이 없으면(404) 모두 허용, 서버 오류(5xx)면 모두 금지로 봐요.

판정은 홈(/)이 아니라 일반 본문 페이지 경로를 기준으로 했어요. 홈만 열어 두고 나머지를 막는 설정(Allow: /$)이 꽤 있어서, 홈만 보면 실제로는 막힌 사이트를 열린 것으로 잘못 세게 돼요.

표 1사이트별 정책 유형 정의
유형정의
전부 허용AI 봇 16종 모두 일반 본문 페이지에 들어올 수 있음
학습용만 막음학습용 봇 중 하나 이상을 막았지만, 검색·실시간 조회용 봇 중 하나 이상은 열려 있음
AI 전부 막음학습용과 검색·실시간 조회용 AI 봇을 모두 막았지만 Googlebot은 허용
검색엔진까지 막음Googlebot까지 막음 (사실상 모든 봇 차단)

학습용: GPTBot·ClaudeBot·anthropic-ai·Google-Extended·CCBot·Bytespider·Applebot-Extended·meta-externalagent·Amazonbot·cohere-ai. 검색·실시간 조회용: OAI-SearchBot·ChatGPT-User·Claude-SearchBot·Claude-User·PerplexityBot·Perplexity-User. 대조군: Googlebot·Bingbot·Yeti(네이버).

홈페이지에서는 스크립트를 실행하지 않고 읽히는 본문 글자 수, 다른 주소로 넘기는 방식(스크립트·메타 리프레시), 링크 수, 구조화 데이터(JSON-LD)를 쟀어요. 본문이 200자 미만이고 링크도 메타 리프레시도 없으면 “”로 분류했어요. 스크립트를 실행하지 않는 크롤러가 그 홈에서 더 나아갈 방법이 없다는 뜻이에요.

업종은 .kr의 2단계 도메인으로 기계적으로 나눴어요(.go.kr 정부·공공, .ac.kr 교육, .or.kr 비영리·연구, .co.kr 기업). 직접 고른 사이트에는 사람이 업종을 붙였어요. 측정 스크립트와 사이트별 판정 결과는 모두 공개해요(저장소의 scripts/research, 이 페이지의 데이터 내려받기).

3.결과

3.1 네 곳 중 세 곳은 AI에게 완전히 열려 있어요

분석한 906곳 중 74.2%는 AI 봇을 하나도 막지 않았어요. 학습용만 막은 곳이 13.2%, AI를 전부 막고 검색엔진만 허용한 곳이 4.5%, 검색엔진까지 막은 곳이 8.1%였어요. robots.txt 파일 자체가 있는 곳은 80.1%였어요.

그림 1업종별 AI 크롤러 정책막대 하나가 업종 하나예요. 강조색이 학습용만 막은 사이트예요.
  • 전부 허용
  • 학습용만 막음
  • AI 전부 막음 (검색엔진은 허용)
  • 검색엔진까지 전부 막음
  • 전체 (906)
  • 언론 (40)
  • 포털·플랫폼 (43)
  • 커머스 (21)
  • 금융 (20)
  • 대기업·브랜드 (32)
  • 기업 (.co.kr) (415)
  • 기타 .kr (151)
  • 정부·공공 (65)
  • 교육 (67)
  • 비영리·연구 (52)

막대에 마우스를 올리면 비율이 보여요. 괄호 안은 사이트 수예요.

BaRam 리서치, 2026-10-02 측정, 906곳. 업종별 표본이 작은 곳(커머스·금융·대기업)은 몇 곳에 따라 비율이 크게 움직여요.

업종 차이가 컸어요. 포털·플랫폼은 전부 허용이 44.2%로 가장 닫혀 있었고, 대기업·브랜드는 96.9%로 거의 다 열려 있었어요. 콘텐츠가 곧 자산인 곳은 막고, 브랜드가 알려지는 게 목적인 곳은 여는 셈이에요.

3.2 가장 많이 막힌 봇은 GPTBot이고, 학습용이 더 많이 막혀요

봇별로 보면 GPTBot이 21.6%로 가장 많이 막혀 있었어요. 학습용 봇 10종의 평균 차단율은 18.6%, 검색·실시간 조회용 6종은 13.6%였어요. 대조군인 Googlebot은 8.1%, 네이버 Yeti는 7.6%였어요.

그림 2봇별 차단율업종을 바꿔 보세요. 언론에서는 학습용과 검색용의 차이가 크게 벌어져요.

학습용 수집

  • GPTBot
    21.6%
  • ClaudeBot
    18.1%
  • Google-Extended
    16.1%
  • CCBot
    19.9%
  • Bytespider
    20.9%
  • Applebot-Extended
    17.9%
  • meta-externalagent
    18.3%
  • Amazonbot
    19.2%
  • cohere-ai
    16.7%
  • anthropic-ai
    17.1%

AI 검색·실시간 조회

  • OAI-SearchBot
    13.7%
  • ChatGPT-User
    14.7%
  • Claude-SearchBot
    13.2%
  • Claude-User
    12.7%
  • PerplexityBot
    14.7%
  • Perplexity-User
    12.7%

일반 검색엔진 (대조군)

  • Googlebot
    8.1%
  • Bingbot
    10.7%
  • Yeti
    7.6%

전체 906곳 중 일반 본문 페이지를 그 봇에게 막아 둔 비율이에요.

BaRam 리서치, 2026-10-02 측정. 일반 본문 페이지 경로를 그 봇에게 막아 둔 사이트 비율.

차단은 대부분 이름을 콕 집어서 이뤄졌어요. robots.txt에 AI 봇 이름을 하나라도 적어 둔 사이트는 157곳(17.3%)이었고, GPTBot 이름을 적은 134곳 중 93곳이 막았어요. 반대로 이름이 덜 알려진 봇일수록 이름이 적힌 경우가 적었어요. Claude-User는 44곳, Perplexity-User는 38곳뿐이었어요. 막으려는 곳도 새로 생긴 봇까지는 따라가지 못하고 있다는 뜻이에요.

3.3 언론: 학습은 거부, AI 답변에는 나오기

언론사 40곳은 가장 뚜렷한 패턴을 보였어요. GPTBot은 45%가 막았는데, 같은 OpenAI의 검색용 OAI-SearchBot은 10%만 막았어요. Google의 학습용 Google-Extended도 22.5%가 막았지만 Googlebot을 막은 곳은 없었어요. 기사가 AI 학습 재료로 쓰이는 건 거부하되, ChatGPT 검색이나 Perplexity 답변에 출처로 걸리는 건 받아들이는 선택이에요.

그림 3언론사 40곳의 AI 봇 정책왼쪽 세 칸은 학습용, 오른쪽 두 칸은 검색용 봇이에요.
언론사GPTBotGoogle-ExtendedClaudeBotOAI-SearchBotPerplexityBotllms.txt
asiae.co.kr●
biz.chosun.com·
bloter.net·
byline.network●
chosun.com·
donga.com·
dt.co.kr·
edaily.co.kr·
etnews.com·
fnnews.com·
hani.co.kr·
hankookilbo.com●
hankyung.com·
heraldcorp.com·
ichannela.com·
imbc.com·
inews24.com·
joongang.co.kr·
jtbc.co.kr·
kbs.co.kr·
khan.co.kr·
kmib.co.kr·
mbn.co.kr·
mediatoday.co.kr·
mk.co.kr●
mt.co.kr·
munhwa.com·
news1.kr●
newsis.com·
nocutnews.co.kr·
ohmynews.com·
pressian.com·
sbs.co.kr·
sedaily.com·
segye.com●
sisain.co.kr·
tvchosun.com·
yna.co.kr·
ytn.co.kr·
zdnet.co.kr·
  • 차단
  • 일부 경로만 막음
  • 허용

BaRam 리서치, 2026-10-02 측정. 각 언론사의 공개 robots.txt·llms.txt 기준. "일부"는 본문은 열고 일부 경로(검색 결과·회원 페이지 등)만 막은 경우예요.

흥미로운 어긋남도 있었어요. 아시아경제와 한국일보는 AI에게 사이트를 소개하는 llms.txt를 만들어 두었지만, robots.txt 에서는 검색용을 포함한 AI 봇 대부분을 막고 있었어요(아시아경제는 16종 전부, 한국일보는 Claude-User 하나만 일부 허용). 소개서는 걸어 두고 문은 잠가 둔 셈이에요. 정책을 만드는 부서와 사이트를 운영하는 부서가 다를 때 흔히 생기는 일이라, AI 정책을 정할 때는 두 파일을 함께 봐야 해요.

3.4 공공·금융: 막은 게 아니라 홈이 비어 있어요

정부·공공 사이트는 robots.txt 로는 84.6%가 열려 있었어요. 그런데 홈페이지를 열어 보니 43.1%가 막다른 길이었어요. 홈 HTML에는 location.href = "/main/index.do" 같은 스크립트 한 줄만 있고, 본문도 링크도 없었어요. 사람의 브라우저는 스크립트를 실행해 진짜 첫 화면으로 넘어가지만, 스크립트를 실행하지 않는 크롤러는 빈 페이지에서 멈춰요.

그림 4홈페이지가 크롤러에게 막다른 길인 비율스크립트를 실행하지 않고 읽히는 본문이 200자 미만이고, 링크도 메타 리프레시도 없는 홈이에요.
  • 금융 (20)
    50%
  • 정부·공공 (65)
    43.1%
  • 커머스 (21)
    42.9%
  • 비영리·연구 (52)
    26.9%
  • 교육 (67)
    23.9%
  • 기타 .kr (151)
    14.6%
  • 포털·플랫폼 (43)
    14%
  • 기업 (.co.kr) (415)
    13.7%
  • 대기업·브랜드 (32)
    9.4%
  • 언론 (40)
    2.5%

사람이 보는 홈

브라우저가 스크립트를 실행해 /main/index.do로 넘어간 뒤 메뉴·배너·공지가 그려져요.

스크립트를 안 돌리는 크롤러가 보는 홈

<html><head>
<script>
  location.href = "/main/index.do";
</script>
</head><body></body></html>

본문 글자가 200자 미만인 홈 272곳 중 119곳은 스크립트로만 다른 주소로 넘기고, 24곳은 빈 앱 껍데기, 10곳은 프레임이었어요. 메타 리프레시(63곳)는 크롤러도 따라가므로 막다른 길에서 뺐어요.

BaRam 리서치, 2026-10-02 측정. 금융(20곳)·커머스는 표본이 작아요. 큰 크롤러 일부는 스크립트를 실행하기도 하지만, 그 범위는 공개돼 있지 않아요.

전체로는 166곳(18.3%)이 막다른 길이었어요. 금융 50%, 교육 23.9% 순으로 높았고, 언론은 2.5%로 가장 낮았어요. 오래된 공공·금융 시스템에서 흔한 “” 방식이 AI 시대에는 robots.txt보다 큰 장벽이 되고 있어요.

3.5 llms.txt는 5.6%, 대기업과 플랫폼 기본값이 이끌어요

AI에게 사이트를 요약해 주는 파일인 llms.txt는 51곳(5.6%)에 있었어요. 대기업·브랜드가 18.8%, 언론이 15%로 높았고, 정부·공공과 교육은 한 곳도 없었어요. 삼성전자·LG전자·현대자동차·무신사·KB국민은행·케이뱅크·티빙·YES24 같은 곳이 이미 두고 있어요.

도입 경로도 보였어요. Cafe24로 만든 쇼핑몰 두 곳은 같은 내용의 llms.txt(“”)를 두고 있었고, 워드프레스 SEO 플러그인(Rank Math)이 만든 파일도 있었어요. 사이트 주인이 직접 만들기보다 쓰는 플랫폼의 기본값이 도입을 이끌기 시작한 거예요.

구조화 데이터(JSON-LD)는 홈 기준 29.6%에 있었어요. 언론·플랫폼·커머스는 절반 이상, 교육은 4.5%였어요.

3.6 robots.txt 밖의 차단: 방화벽

측정한 1,133곳 중 42곳은 우리 측정 요청 자체를 403으로 거절했어요. 쿠팡·G마켓·SSG.COM·올리브영·오늘의집·빗썸 같은 대형 커머스·금융 사이트가 포함돼 있어요. 이 사이트들의 robots.txt가 AI 봇을 허용하더라도, 방화벽이 처음 보는 봇을 막는다면 AI 크롤러도 같은 일을 겪을 가능성이 커요.

3.7 의도하지 않은 차단: 구글만 허용 목록에

32곳은 AI 봇 이름을 하나도 적지 않았는데도 AI를 막고 있었어요. 모든 봇(*)을 막은 뒤 Googlebot·Yeti 같은 검색엔진만 따로 허용해 둔 경우예요. 이 설정은 AI 검색이 생기기 전에는 합리적이었지만, 지금은 ChatGPT 검색과 Perplexity 답변에서도 빠지게 만들어요. 운영자가 AI를 막겠다고 결정한 적이 없는데 막혀 있는 셈이에요.

4.논의

학습과 검색을 나누는 정책이 자리 잡고 있어요

OpenAI·Anthropic·Perplexity는 학습용과 검색용 봇을 나눠 운영해요. Google도 Googlebot과 별개로 학습 통제용 Google-Extended를 두고 있어요. 이번 조사에서 GPTBot은 막고 OAI-SearchBot은 연 사이트가 74곳이었고, 언론에서는 이게 다수 정책이었어요. AI를 통째로 막을지 말지가 아니라, 무엇에 쓰이는 걸 허용할지 고르는 단계로 넘어가고 있어요.

차단은 이름이 알려진 봇에 몰려요

차단은 GPTBot·CCBot·Bytespider처럼 일찍 알려진 이름에 몰려 있었어요. Claude-User·Perplexity-User처럼 최근 생긴 실시간 조회 봇은 이름이 적힌 경우가 드물었어요. 사이트들이 정책을 한 번 정한 뒤 갱신하지 않는다는 신호이고, 새 봇은 대부분 모든 봇(*) 규칙을 따르게 돼요.

한국 웹의 진짜 장벽은 오래된 구조예요

AI를 의도적으로 막은 사이트(학습용만 막음 + AI 전부 막음)는 17.7%였지만, 홈이 막다른 길인 사이트는 18.3%였어요. 특히 공공·금융·교육처럼 신뢰도가 높아 AI가 인용하고 싶어 할 만한 출처일수록 이 비율이 높았어요. AI 검색에서 한국 공공 정보가 덜 인용된다면, 원인은 정책이 아니라 구조일 가능성이 커요.

5.한계

  • Tranco는 트래픽이 많은 사이트 위주라 중소기업·소상공인 사이트는 거의 들어 있지 않아요. 결과는 “”를 대표해요.
  • 업종 분류 중 2단계 도메인 기준은 기계적이지만, 직접 고른 사이트의 업종은 사람의 판단이에요. 커머스·금융·대기업 표본은 20~40곳으로 작아요.
  • 2026-10-02 하루의 스냅샷이에요. robots.txt는 자주 바뀌므로 같은 측정을 반복해 추세를 봐야 해요.
  • robots.txt는 의사 표시일 뿐이에요. 실제 AI 봇이 이를 지키는지, 막힌 사이트가 AI 답변에서 정말 빠지는지는 이번 조사 범위 밖이에요.
  • 막다른 길 판정은 HTML을 읽는 규칙으로 했어요. 스크립트를 실행하는 크롤러에게는 다르게 보일 수 있어요.
  • 방화벽 차단(3.6절)은 우리 측정 봇 기준이에요. AI 회사의 봇이 같은 대우를 받는지는 알 수 없어요.

6.실무 시사점

AI 검색에 나오고 싶은 사이트라면 다음 순서로 점검하세요.

  • 학습과 검색을 나눠 정하세요. 학습은 원치 않아도 AI 답변에는 나오고 싶다면 GPTBot·Google-Extended·ClaudeBot은 막고 OAI-SearchBot·ChatGPT-User·PerplexityBot·Claude-SearchBot은 열어 두는 게 언론사들이 고른 방식이에요.
  • 모든 봇(*) 차단 + 검색엔진 허용 목록을 쓰고 있다면 다시 보세요. AI 검색 봇도 함께 막혀요. 원하는 AI 검색 봇 이름을 허용 목록에 더해야 해요.
  • 홈이 스크립트로만 넘어가지 않게 하세요. 첫 화면 이동은 서버 리다이렉트(301·302)나 메타 리프레시로 바꾸고, 홈 HTML에 주요 메뉴 링크를 남겨 두세요.
  • 방화벽 설정을 확인하세요. 보안 업체 설정에서 검증된 AI 검색 봇이 막히고 있지 않은지 로그로 확인하세요.
  • llms.txt와 robots.txt를 함께 관리하세요. llms.txt를 두고도 robots.txt로 막고 있으면 의미가 없어요.

부록.사이트 찾아보기

이번에 측정한 906곳의 판정을 직접 찾아볼 수 있어요. 도메인 일부만 입력해도 돼요.

그림 5측정한 사이트의 AI 봇 정책

    BaRam 리서치, 2026-10-02 측정. 판정이 실제와 다르면 측정 이후 robots.txt가 바뀌었을 수 있어요.

    자주 묻는 질문

    GPTBot을 막으면 ChatGPT 검색 답변에도 안 나오나요?

    아니에요. OpenAI는 학습용 GPTBot과 검색용 OAI-SearchBot, 사용자 요청 시 페이지를 여는 ChatGPT-User를 따로 운영해요. GPTBot만 막으면 학습에는 안 쓰이지만 ChatGPT 검색 답변에는 계속 나올 수 있어요. 이번 조사에서 언론사의 47.5%가 바로 이렇게 설정해 두었어요.

    우리 사이트가 AI 봇을 막고 있는지 어떻게 확인하나요?

    사이트 주소 뒤에 /robots.txt를 붙여 열어 보세요. GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot 같은 이름 아래 Disallow: / 가 있으면 막혀 있는 거예요. 이름이 없더라도 User-agent: * 아래 Disallow: / 가 있으면 구글을 따로 허용해 두지 않는 한 AI 봇도 함께 막혀요. 이 페이지 맨 아래에서 이번에 측정한 사이트를 직접 찾아볼 수도 있어요.

    llms.txt는 꼭 있어야 하나요?

    아직 표준이 아니고, 이번 조사에서도 5.6%만 두고 있었어요. 없다고 불이익이 있다는 근거는 없어요. 다만 대기업 브랜드는 18.8%가 두고 있어서 도입이 빠르게 늘고 있는 건 분명해요. 만드는 데 품이 적게 드니 해 두면 손해는 없어요.

    robots.txt를 열어 두면 AI가 우리 사이트를 다 읽어 가나요?

    그렇지 않을 수 있어요. 이번 조사에서 홈페이지가 스크립트로만 다른 주소로 넘기거나 빈 앱 껍데기여서, 스크립트를 실행하지 않는 크롤러에게 아무 내용도 보여 주지 못하는 사이트가 18.3%였어요. 정부·공공 사이트는 43.1%였고요. robots.txt보다 이쪽이 더 큰 장벽인 사이트가 많아요.

    인용하기

    기사·보고서·블로그에 자유롭게 인용해도 돼요. 출처와 이 페이지 주소를 함께 적어 주세요.

    BaRam 리서치 (2026). 한국 웹사이트 906곳의 AI 크롤러 정책 조사 (BRR-2026-01). https://www.baram.live/research/korea-ai-crawler-policy-2026

    참고문헌

    1. Koster, M., Illyes, G., Zeller, H., & Sassman, L. (2022). Robots Exclusion Protocol. RFC 9309, IETF. https://www.rfc-editor.org/rfc/rfc9309
    2. Le Pochat, V., Van Goethem, T., Tajalizadehkhoob, S., Korczyński, M., & Joosen, W. (2019). Tranco: A Research-Oriented Top Sites Ranking Hardened Against Manipulation. NDSS 2019. https://tranco-list.eu
    3. Longpre, S. 외 (2024). Consent in Crisis: The Rapid Decline of the AI Data Commons. arXiv:2407.14933. https://arxiv.org/abs/2407.14933
    4. OpenAI. Overview of OpenAI Crawlers (GPTBot, OAI-SearchBot, ChatGPT-User). https://platform.openai.com/docs/bots
    5. Google. Google의 일반 크롤러 — Google-Extended. https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
    6. Perplexity. Perplexity Crawlers (PerplexityBot, Perplexity-User). https://docs.perplexity.ai/guides/bots
    7. Howard, J. (2024). The /llms.txt file. https://llmstxt.org

    우리 사이트를 AI가 제대로 읽고 있을까요?

    robots.txt 설정, 홈페이지가 막다른 길인지, 구조화 데이터와 llms.txt까지 37개 항목으로 무료 진단해 드려요. 주소만 넣으면 돼요.

    • 로그인도 결제도 없이 바로 실행
    • 37개 항목 채점, 약 1분 소요
    • 오픈소스 CLI로도 같은 검사 가능