Список AI-краулерів 2026: user-agent і robots.txt по ботах
· 18 хв читання · Оновлено
In English: AI Crawler List 2026: Every User-Agent, robots.txt per Bot — read in English
Станом на 26 серпня 2026 року варто знати сорок чотири токени user-agent, повʼязані з AI, і чотири вендори у власній документації заявляють, що частина їхніх ботів ігнорує robots.txt. Тридцять сім із сорока чотирьох мають сторінку від першої особи; решта сім, дві з яких Anthropic вивела з ужитку, тримаються на списку спільноти. Повна таблиця нижче, за вендорами, зі списком IP для перевірки кожного. Спершу - що означають категорії, бо «заблокувати AI» - це три різні рішення.
Коротко#
- AI-боти бувають трьох видів: тренувальні краулери, пошукові індексатори і завантажувачі на запит користувача. Кожен вендор документує їх окремо й дозволяє дозволяти чи блокувати кожного незалежно.
- Завантажувачі на запит користувача здебільшого не поважають robots.txt. OpenAI, Perplexity, Google і Meta кажуть це у власних доках. Блокувати їх - робота фаєрвола, а не robots.txt.
- Більшість великих вендорів тепер публікують список IP у JSON; Meta дає натомість номер AS, а Mistral покриває лише два боти з трьох. Перевіряйте за IP, ніколи за рядком User-Agent.
- У моєму скані 53 файлів robots.txt (26 серпня 2026) лише 6 сайтів повністю блокують хоч якогось AI-бота, 5 публікують рядок
Content-Signal, а 2 досі тримають виведений з ужитку токенanthropic-aiпоруч із чинною групоюClaudeBot. - Наприкінці - три готові конфіги: дозволити все, заблокувати лише тренування, заблокувати весь AI.
Що вважати AI-краулером#
AI-краулер - це будь-який автоматичний клієнт, який завантажує вебсторінки для продукту на основі великої мовної моделі. Назва накриває три різні роботи, які вендори виконують окремими ботами з окремими правилами. Тренувальний краулер збирає текст, щоб навчити наступну модель. Пошуковий індексатор будує індекс, з якого відповідь дістає підкріплення й цитати. Завантажувач на запит користувача відкриває один URL, бо людина попросила асистента його прочитати.
Різниця важлива, бо політики вендорів різняться саме за роботою. Сторінка ботів OpenAI каже, що кожне з трьох її налаштувань robots.txt «незалежне від інших» (OpenAI, Overview of OpenAI crawlers). Документація Google ділить краулерів на «звичайних», які «завжди поважають правила robots.txt при автоматичному обході», і «завантажувачів на запит користувача», які «здебільшого ігнорують правила robots.txt» (Google Search Central, user-triggered fetchers).
Дозволити бота - лише перша з чотирьох умов, і ця стаття вичерпно покриває саме першу. Якщо ви вже дозволили все й досі нічого не бачите, причина зазвичай далі по ланцюжку: why your site doesn't show in ChatGPT and Perplexity розбирає режими збою за порядком, а the JavaScript trap - найпоширеніший із них, коли сторінка дозволена, завантажена й порожня, бо бот не виконує ваш JavaScript.
Повний список AI-краулерів, за документами вендорів#
Категорії: T - тренування моделі, S - пошуковий індекс або добування, U - завантаження на запит користувача, O - інше. «Поважає robots.txt» повторює власну заяву вендора; «немає доків» означає, що я не знайшов сторінки від першої особи, і запис тримається на списку спільноти ai-robots-txt/ai.robots.txt.
| Токен user-agent | Власник | Тип | Поважає robots.txt | Список IP / перевірка |
|---|---|---|---|---|
GPTBot |
OpenAI | T | Так | openai.com/gptbot.json |
OAI-SearchBot |
OpenAI | S | Так | openai.com/searchbot.json |
ChatGPT-User |
OpenAI | U | Ні: «правила robots.txt можуть не діяти» | openai.com/chatgpt-user.json |
OAI-AdsBot |
OpenAI | O (рекламні лендинги) | Не вказано | openai.com/adsbot.json |
ClaudeBot |
Anthropic | T | Так, плюс Crawl-delay |
claude.com/crawling/bots.json |
Claude-User |
Anthropic | U | Так (заява вендора покриває всі три) | той самий файл |
Claude-SearchBot |
Anthropic | S | Так | той самий файл |
anthropic-ai, Claude-Web |
Anthropic | виведені з ужитку | Немає на чинній сторінці Anthropic | немає |
PerplexityBot |
Perplexity | S | Так | perplexity.com/perplexitybot.json |
Perplexity-User |
Perplexity | U | Ні: «здебільшого ігнорує правила robots.txt» | perplexity.com/perplexity-user.json |
Googlebot |
S | Так | common-crawlers.json, rDNS *.googlebot.com |
|
Google-Extended |
T (лише керівний токен) | Так | власного UA немає; обходить як Googlebot | |
GoogleOther, GoogleOther-Image, GoogleOther-Video |
O (дослідницькі завантаження) | Так | common-crawlers.json | |
Google-CloudVertexBot |
S (агенти Vertex AI) | Так | common-crawlers.json | |
Google-Agent |
U | Ні: «здебільшого ігнорують robots.txt» | user-triggered-agents.json | |
Google-GeminiNotebook |
U (NotebookLM) | Ні | user-triggered-fetchers.json | |
bingbot |
Microsoft | S (живить і пошук ChatGPT) | Так, за довідкою Bing | bingbot.json на bing.com; довідкові сторінки Bing у мене не відкрилися 26 серпня 2026 |
Applebot |
Apple | S + T | Так, плюс noindex, nosnippet, X-Robots-Tag: applebot: |
applebot.json, rDNS *.applebot.apple.com |
Applebot-Extended |
Apple | T (керівний токен) | Так; «не обходить вебсторінки» | власного UA немає |
meta-externalagent |
Meta | T + S | Так | whois -h whois.radb.net -- '-i origin AS32934' |
meta-externalfetcher |
Meta | U | Ні: «може обходити правила robots.txt» | AS32934 |
meta-webindexer |
Meta | S (пошук Meta AI) | Так | AS32934 |
facebookexternalhit |
Meta | O (прев'ю посилань) | Частково | AS32934 |
Amazonbot |
Amazon | T + S | Так, плюс noindex, noarchive |
amazonbot/ip-addresses |
Amzn-SearchBot |
Amazon | S (без тренування) | Так | searchbot-ip-addresses |
Amzn-User |
Amazon | U (Alexa) | Перелічений під REP, без застережень | live-ip-addresses |
MistralAI-Training |
Mistral | T | Так | немає: Mistral публікує списки IP лише для Index і User |
MistralAI-Index |
Mistral | S (без тренування) | Мається на увазі | mistralai-index-ips.json |
MistralAI-User |
Mistral | U | Не вказано | mistralai-user-ips.json |
DuckAssistBot |
DuckDuckGo | S/U (без тренування) | Так, застосовує протягом 72 годин | duckassistbot.json |
CCBot |
Common Crawl | T (відкритий корпус) | Так | ccbot.json, rDNS *.crawl.commoncrawl.org |
Bytespider |
ByteDance | T | Доків немає; список спільноти каже ні | немає |
Diffbot, Diffbot-User |
Diffbot | O + U | Так за замовчуванням | немає |
omgili / omgilibot |
Webz.io | O (перепродаж даних) | Так | немає |
ImagesiftBot |
Hive | O (зображення) | Так, відкочується до правил Googlebot | немає |
YouBot |
You.com | S | Доків немає | немає |
cohere-ai, cohere-training-data-crawler |
Cohere | U / T | Доків немає | немає |
Timpibot |
Timpi | T | Доків немає | немає |
Два числа дають таблиці масштаб. Підтримуваний спільнотою robots.json на ai-robots-txt 26 серпня 2026 року містив 166 токенів, здебільшого дрібних або неперевірених операторів. Довідник Cloudflare AI Crawl Control перелічує 20 ботів, яких він може перевірити криптографічно або за IP, у групах AI Crawler, AI Search, AI Assistant і Search Engine (Cloudflare, AI Crawl Control bots).
Які AI-боти ігнорують robots.txt#
Чотири боти у власній документації кажуть, що robots.txt може до них не застосовуватись, і всі чотири - завантажувачі на запит користувача. OpenAI: для ChatGPT-User «правила robots.txt можуть не діяти», бо дії ініціює користувач. Perplexity: Perplexity-User «здебільшого ігнорує правила robots.txt» (Perplexity, Crawlers). Google: завантажувачі на запит користувача «здебільшого ігнорують правила robots.txt», бо «завантаження попросив користувач». Meta: meta-externalfetcher «може обходити правила robots.txt» (Meta, Web crawlers).
Логіка в усіх вендорів однакова: людина вставила ваш URL в асистента, тож завантаження трактують як візит браузера. Якщо вам треба спинити саме їх, robots.txt - не той інструмент. Беріть правило WAF або налаштування Cloudflare «Block AI bots», яке з липня 2026 року цілиться в три поведінки - Search, Agent і Training - і застосовується до «перевірених ботів з такою поведінкою плюс додаткових неперевірених» (Cloudflare, Block AI bots).
Anthropic - виняток серед великих вендорів: її сторінка каже, що «боти Anthropic поважають сигнали „не обходити“, шануючи галузеві стандартні директиви в robots.txt», і називає всі три боти, включно з Claude-User (Anthropic, Does Anthropic crawl data from the web).
Чи означає noindex щось для AI-краулерів#
Для OpenAI й Anthropic - ні. Жодна зі сторінок про ботів не згадує метатеги robots чи X-Robots-Tag; обидві описують robots.txt як єдиний контроль. Я писав протилежне в ранішій статті на цьому сайті і виправив це там; чесна позиція така: noindex документують рівно два вендори, дотичні до AI. Apple заявляє, що Applebot поважає noindex, nosnippet («блокує генерацію опису й використання в AI-моделі як контексту»), nofollow, none і обмежений X-Robots-Tag: applebot: nosnippet (Apple, About Applebot). Amazon заявляє, що Amazonbot поважає noarchive, noindex і none (Amazon, Amazonbot).
Є ще одна тонкість. Сторінку, заблоковану в robots.txt, ніхто не завантажує, тож noindex на ній ніхто й не побачить. Якщо ваша мета - «завантажуйте, але не цитуйте», robots.txt цього не висловлює; найближче до такого прохання - nosnippet від Apple і рядок Content-Signal нижче.
Як перевірити краулера за IP#
Рядок User-Agent - це вільний текст у заголовку. Будь-хто, хто парсить ваш сайт, може надіслати Mozilla/5.0 (compatible; GPTBot/1.1) і успадкувати всі дозволи, які ви дали OpenAI. Перевірка означає звірку IP джерела зі списком, який публікує вендор, і більшість великих тепер віддають його як JSON. Прогалини варто знати до того, як писати правило: Meta публікує номер AS замість файлу, а Mistral покриває MistralAI-Index і MistralAI-User, але не MistralAI-Training.
# scripts/verify-ai-bot.sh
# Usage: ./scripts/verify-ai-bot.sh <ip> <vendor>
# vendor: openai | anthropic | perplexity | google | apple | commoncrawl | mistral | duckduckgo
set -euo pipefail
ip="$1"; vendor="$2"
case "$vendor" in
openai) urls="https://openai.com/gptbot.json https://openai.com/searchbot.json https://openai.com/chatgpt-user.json" ;;
anthropic) urls="https://claude.com/crawling/bots.json" ;;
perplexity) urls="https://www.perplexity.com/perplexitybot.json https://www.perplexity.com/perplexity-user.json" ;;
google) urls="https://developers.google.com/static/crawling/ipranges/common-crawlers.json https://developers.google.com/static/crawling/ipranges/user-triggered-fetchers.json https://developers.google.com/static/crawling/ipranges/user-triggered-agents.json" ;;
apple) urls="https://search.developer.apple.com/applebot.json" ;;
commoncrawl) urls="https://index.commoncrawl.org/ccbot.json" ;;
mistral) urls="https://mistral.ai/mistralai-index-ips.json https://mistral.ai/mistralai-user-ips.json" ;;
duckduckgo) urls="https://duckduckgo.com/duckassistbot.json" ;;
*) echo "unknown vendor"; exit 2 ;;
esac
python3 - "$ip" $urls <<'PY'
import ipaddress, json, sys, urllib.request
ip = ipaddress.ip_address(sys.argv[1])
for url in sys.argv[2:]:
data = json.load(urllib.request.urlopen(url, timeout=15))
prefixes = []
def walk(node):
if isinstance(node, dict):
for key, value in node.items():
if key in ("ipv4Prefix", "ipv6Prefix", "prefix", "cidr") and isinstance(value, str):
prefixes.append(value)
else:
walk(value)
elif isinstance(node, list):
for item in node:
walk(item)
elif isinstance(node, str) and "/" in node:
prefixes.append(node)
walk(data)
for prefix in prefixes:
try:
if ip in ipaddress.ip_network(prefix, strict=False):
print(f"MATCH {ip} in {prefix} ({url})")
sys.exit(0)
except ValueError:
continue
print(f"NO MATCH for {ip}")
sys.exit(1)
PYСкрипт обходить будь-яку з форм JSON у вендорів (OpenAI і Google використовують prefixes[].ipv4Prefix, Anthropic і Perplexity - пласкі списки) і виходить з кодом 0 при збігу. Meta не публікує JSON; беріть whois -h whois.radb.net -- '-i origin AS32934' | grep ^route і звіряйте з цими маршрутами. Google і Apple додатково підтримують зворотний DNS: справжній Googlebot резолвиться в *.googlebot.com або *.geo.googlebot.com, справжній Applebot - у *.applebot.apple.com.
Де б ви не хостились, найдешевше місце логувати кандидатів - той шар на краю або middleware, який у вашого фреймворку вже є: middleware.ts у застосунку на Next.js, або що там працює перед обробником маршруту деінде. Зіставляйте User-Agent із токенами вище, пишіть у лог запитів ua, ip і path, і щотижня проганяйте скрипт по цих IP. Той самий лог - сировина для того, щоб вимірювати AI-видимість, а не припускати її: аудит AI-видимості вручну описує перевірки й ті числа, які цей сайт дав, коли прогнав їх по собі.
Що насправді роблять 53 сайти: скан за серпень 2026#
26 серпня 2026 року я завантажив robots.txt із 65 доменів: блоги інструментів AI-видимості й технічні SEO-сайти, що конкурують із цим; фреймворки й хости, які читає розробник (Vercel, Next.js, MDN, Cloudflare, Kinsta, WP Engine); добірка видань; і 12 українських агенцій, медіа й маркетплейсів. 53 файли виявились читабельними; 12 віддали HTML-обгортку, 403 або перевірку на бота і були виключені. «Блокує» нижче означає групу саме для цього токена з Disallow: /.
| Знахідка | Кількість | Частка з 53 |
|---|---|---|
| Повністю блокують щонайменше один AI-токен | 6 | 11,3% |
Блокують GPTBot |
3 (medium.com, forbes.com, techcrunch.com) | 5,7% |
Блокують ClaudeBot |
3 (ті самі три) | 5,7% |
Блокують Bytespider |
4 | 7,5% |
Блокують Amazonbot |
4 (medium.com, forbes.com, notion.so, dou.ua) | 7,5% |
Блокують виведені з ужитку anthropic-ai або Claude-Web |
2 (forbes.com, techcrunch.com) | 3,8% |
Публікують рядок Content-Signal: |
5 (vercel.com, kinsta.com, cloudflare.com, supabase.com, agent-ready.dev) | 9,4% |
Блокують хоч якогось завантажувача на запит користувача (ChatGPT-User, Perplexity-User, Claude-User) |
1 (techcrunch.com блокує ChatGPT-User) |
1,9% |
| Українські домени (12 читабельних), що блокують хоч якийсь AI-токен | 1 (dou.ua, лише Amazonbot) |
8,3% з 12 |
Впадають в око три речі. Перше: блокування зосереджене у видань - medium.com блокує шість токенів, forbes.com девʼять, techcrunch.com девʼять. Кожен SEO-блог, кожен сайт фреймворку і кожна українська агенція у вибірці дозволяють усе; єдиний сайт для розробників, який щось блокує, - agent-ready.dev, і він блокує CCBot і Bytespider, явно лишаючи дозволеними пошукових ботів. Друге: поширення Content-Signal - історія про інфраструктуру, а не про редакційну політику: чотири з пʼяти сайтів, що його публікують (Vercel, Kinsta, Cloudflare, Supabase), - хостинг- або CDN-компанії, чий керований robots.txt додає цей рядок сам. Третє: techcrunch.com блокує ChatGPT-User і Claude-Web, з яких перший ігнорує robots.txt за власним визнанням OpenAI, а другого більше не існує.
Метод і межі: одне завантаження на домен звичайним HTTP-клієнтом; сайти, які віддають різний robots.txt різним user-agent, не перевірялись; 12 нечитабельних файлів зміщують вибірку геть від великих видань, а саме вони найімовірніше блокують. Сирий CSV - у посиланні наприкінці.
Content-Signal і чернетка IETF: побажання за призначенням, а не за ботом#
Модель «на кожного бота» не масштабується: 166 токенів у списку спільноти, і кожен новий продукт додає ще один. Два зусилля висловлюють побажання за сценарієм використання.
Керований robots.txt від Cloudflare додає рядок на кшталт Content-Signal: search=yes, ai-train=no, use=reference. У словнику три ключі: search для «побудови пошукового індексу й видачі результатів», ai-input для «подавання контенту в одну чи кілька AI-моделей (наприклад, RAG, підкріплення відповіді)» і ai-train для «тренування або донавчання AI-моделей». Дотримання добровільне (Cloudflare, Managed robots.txt).
Робоча група IETF AI Preferences стандартизує ту саму ідею. draft-ietf-aipref-vocab-07 (19 серпня 2026) визначає train-ai і search зі значеннями y, n або невідомо, а draft-ietf-aipref-attach-05 визначає HTTP-заголовок Content-Usage і правило в robots.txt - наприклад, Content-Usage: train-ai=n для всього сайту або Content-Usage: /ai-ok/ train-ai=y для шляху (IETF, draft-ietf-aipref-attach). Чернетка прямо каже, що «побажання не є механізмом безпеки». Сьогодні жоден краулер нічого з цих двох документів не забезпечує примусово, але коштує це один рядок, і пʼять хостингових компаній з мого скану вже його віддають.
Три готові robots.txt#
Кожен варіант зберігає Sitemap: і правила для параметрів, які цей сайт уже використовує; свої Disallow для адмінських шляхів додавайте в групу *.
Варіант 1: дозволити все й заявити свою позицію#
Беріть його, якщо хочете цитувань від AI і згодні на тренування. Саме так працює alexturik.com.
# public/robots.txt
User-agent: *
Allow: /
Content-Signal: search=yes, ai-input=yes, ai-train=yes
Sitemap: https://example.com/sitemap.xmlВаріант 2: заблокувати тренування, лишити пошук і асистентів#
Беріть його, якщо хочете, щоб вас цитували пошук ChatGPT, Perplexity, Claude і AI-функції Google, але не хочете потрапити в наступний тренувальний набір. Токени нижче - це суто тренувальні боти й керівні токени; пошукові й запущені користувачем лишаються дозволеними групою *.
# public/robots.txt
User-agent: *
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: MistralAI-Training
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: cohere-training-data-crawler
Disallow: /
User-agent: Timpibot
Disallow: /
Content-Signal: search=yes, ai-input=yes, ai-train=no
Sitemap: https://example.com/sitemap.xmlДва застереження. meta-externalagent і Amazonbot і тренують, і індексують, тож блокування прибирає вас із пошуку Meta AI і відповідей Alexa; Amzn-SearchBot від Amazon лишається дозволеним і не тренує. Applebot-Extended блокує тренування, лишаючи Siri й пошук Spotlight на Applebot.
Варіант 3: заблокувати всіх задокументованих AI-ботів#
Беріть його, тільки якщо вирішили, що AI-трафік не має для вас цінності. Памʼятайте: чотири завантажувачі на запит користувача все одно відкриють сторінку, коли попросить людина; спинити їх можна лише правилом фаєрвола.
# public/robots.txt
User-agent: *
Allow: /
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Google-CloudVertexBot
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: meta-externalfetcher
User-agent: meta-webindexer
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: MistralAI-Training
User-agent: MistralAI-Index
User-agent: MistralAI-User
User-agent: DuckAssistBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Diffbot
User-agent: omgili
User-agent: ImagesiftBot
User-agent: YouBot
User-agent: cohere-ai
User-agent: cohere-training-data-crawler
User-agent: Timpibot
Disallow: /
Content-Signal: search=no, ai-input=no, ai-train=no
Sitemap: https://example.com/sitemap.xmlСкладені підряд рядки User-agent в одній групі валідні за RFC 9309, розділ 2.2.1, і кожен перелічений вище парсер їх підтримує (RFC 9309, Robots Exclusion Protocol). Googlebot, bingbot і Applebot у варіанті 3 свідомо відсутні: блокування прибирає вас із класичного пошуку, а «заблокувати AI» зазвичай означає не це.
Як перевірити результат#
Після деплою переконайтесь, що файл парситься так, як ви думаєте. Звіт robots.txt у Google Search Console показує завантажений файл і помилки розбору. Для конкретного бота найшвидша перевірка - пошук групи через curl і awk:
# scripts/robots-check.sh
# Usage: ./scripts/robots-check.sh https://example.com GPTBot
set -euo pipefail
site="$1"; bot="$(echo "$2" | tr 'A-Z' 'a-z')"
curl -sL "$site/robots.txt" | awk -v bot="$bot" '
BEGIN { ing = 0 }
/^[ \t]*[Uu]ser-[Aa]gent:/ {
ua = tolower($0); sub(/^[ \t]*user-agent:[ \t]*/, "", ua); gsub(/[ \t\r]+$/, "", ua)
if (ua == bot) { ing = 1; print "group: " $0 } else if (!prev) { ing = 0 }
prev = 1; next
}
{ prev = 0 }
ing && /^[ \t]*([Dd]isallow|[Aa]llow|[Cc]rawl-delay):/ { print " " $0 }
'Проженіть його по своєму продакшн-URL для кожного доданого токена. Якщо він нічого не друкує, групи немає або вона з друкарською помилкою; найчастіші помилки у файлах, які я сканував, - GPTbot, Claude-bot і Perplexity Bot із пробілом.
Браузерна версія того самого питання: розширення AEO Checker перевіряє robots.txt відкритої вкладки однією з девʼяти своїх перевірок, і це швидший спосіб подивитись на чужий сайт. Його обсяг свідомо вужчий за цю статтю: десять токенів, чотири в реальному часі й шість тренувальних, згорнуті в один вердикт «пройдено/попередження/провал», а не роздруковані по групах. Він також досі тримає в тому списку anthropic-ai, який таблиця вище позначає виведеним з ужитку. Це застарілий запис, який я розширенню винен, і водночас гарна ілюстрація того, як швидко старіє захардкоджений список ботів.
Історія змін#
- 2026-08-27: перша версія. 44 токени в 38 рядках таблиці, скан 53 сайтів, Content-Signal і
draft-ietf-aipref-attach-05від IETF.
FAQ#
Які AI-краулери ігнорують robots.txt#
За власною документацією: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Google-Agent та інші завантажувачі Google на запит користувача, і meta-externalfetcher (Meta). Усі чотири - завантажувачі на запит користувача: людина попросила асистента відкрити ваш URL, тож вендор трактує запит як користувацький, а не ботівський. Тренувальні й пошукові краулери тих самих вендорів robots.txt поважають.
Чи прибере блокування GPTBot мій сайт із пошуку ChatGPT#
Ні. OpenAI тримає три окремі боти з незалежними правилами. GPTBot відповідає за тренування, OAI-SearchBot - за відповіді пошуку ChatGPT, а ChatGPT-User завантажує сторінки на запит користувача. Блокування самого лише GPTBot лишає вас придатними для цитувань у пошуку; блокування OAI-SearchBot прибирає вас із пошукових відповідей, але не з навігаційних посилань.
Як переконатися, що запит справді прийшов від GPTBot чи ClaudeBot#
Звірте IP запиту з опублікованими діапазонами вендора. OpenAI віддає openai.com/gptbot.json, Anthropic - claude.com/crawling/bots.json, Perplexity - perplexity.com/perplexitybot.json, Google публікує файли JSON під developers.google.com/static/crawling/ipranges/. Сам лише рядок User-Agent не доводить нічого: його може надіслати будь-який скрипт.
Чи є Google-Extended краулером#
Ні. У Google-Extended немає власного рядка user-agent. Це керівний токен для robots.txt: обхід і далі виконує Googlebot, а Disallow для Google-Extended каже Google не використовувати завантажений контент для тренування майбутніх моделей Gemini чи для підкріплення відповідей у Gemini Apps і Vertex AI. На потрапляння в пошук Google це не впливає.
Що таке Content-Signal у robots.txt#
Рядок, який додає керований robots.txt від Cloudflare, наприклад Content-Signal: search=yes, ai-train=no, use=reference. Він виражає побажання за сценарієм використання, а не за ботом. Дотримання добровільне, а IETF стандартизує споріднений словник (train-ai, search) у робочій групі AI Preferences. У моєму скані за серпень 2026 його публікували 5 із 53 сайтів.
Як часто оновлювати список AI-краулерів у robots.txt#
Перевіряйте щокварталу. Між 2024 і 2026 роками Anthropic вивела з ужитку anthropic-ai і Claude-Web та додала Claude-User і Claude-SearchBot; OpenAI додала OAI-SearchBot і OAI-AdsBot; Mistral додала три боти. Два з 53 просканованих сайтів досі тримають виведений токен anthropic-ai; обидва блокують і ClaudeBot, тож застарілий рядок лише додає шуму. А от файл, у якому стоїть сам anthropic-ai, не блокував би нічого з того, що Anthropic запускає сьогодні.
Джерела#
- OpenAI, Overview of OpenAI crawlers - три боти й заява, що кожне налаштування robots.txt незалежне
- Anthropic, Does Anthropic crawl data from the web - три чинні токени й зобовʼязання, що покриває всіх
- Perplexity, Crawlers - PerplexityBot проти Perplexity-User
- Google Search Central, Google common crawlers
- Google Search Central, User-triggered fetchers - звідки взято «здебільшого ігнорують правила robots.txt»
- Google Search Central, Verifying Googlebot - метод зворотного DNS і діапазонів IP
- Apple, About Applebot - єдина сторінка вендора, яка документує
noindexіnosnippetдля AI-краулера - Meta, Web crawlers
- Amazon, Amazonbot - друга така
- Mistral, Robots
- DuckDuckGo, DuckAssistBot
- Common Crawl, CCBot
- Diffbot, robots.txt FAQ
- Cloudflare, AI Crawl Control bots reference - 20 ботів, яких Cloudflare може перевірити
- Cloudflare, Block AI bots - відповідь фаєрвола на завантажувачів за запитом користувача
- Cloudflare, Managed robots.txt and Content Signals - словник
Content-Signal - IETF, draft-ietf-aipref-vocab
- IETF, draft-ietf-aipref-attach - заголовок
Content-Usageі правило в robots.txt - IETF, RFC 9309 Robots Exclusion Protocol - розділ 2.2.1 про складені рядки
User-agent - Список спільноти ai-robots-txt - список на 166 токенів і єдине джерело для семи токенів без сторінки вендора
- Сирі дані скану - усі 65 доменів, завантажених 26 серпня 2026 року, по рядку на кожен
Частина кластера Answer Engine Optimization - повний порядок читання і глосарій усіх термінів, що трапляються в цих статтях.