---
title: "Список AI-краулерів 2026: user-agent і robots.txt по ботах"
description: "44 токени AI user-agent із власниками й списками IP, які з них ігнорують robots.txt, три готові robots.txt і скан 53 живих файлів за серпень 2026."
date: 2026-08-27
updated: 2026-08-30
translationOf: ai-crawler-list-robots-txt-2026
tags: [ai-search, robots-txt, aeo, measurement]
---

# Список AI-краулерів 2026: user-agent і robots.txt по ботах

Станом на 26 серпня 2026 року варто знати сорок чотири токени user-agent, повʼязані з AI, і чотири вендори у власній документації заявляють, що частина їхніх ботів ігнорує robots.txt. Тридцять сім із сорока чотирьох мають сторінку від першої особи; решта сім, дві з яких Anthropic вивела з ужитку, тримаються на списку спільноти. Повна таблиця нижче, за вендорами, зі списком IP для перевірки кожного. Спершу - що означають категорії, бо «заблокувати AI» - це три різні рішення.

## Коротко

- AI-боти бувають трьох видів: тренувальні краулери, пошукові індексатори і завантажувачі на запит користувача. Кожен вендор документує їх окремо й дозволяє дозволяти чи блокувати кожного незалежно.
- Завантажувачі на запит користувача здебільшого не поважають robots.txt. OpenAI, Perplexity, Google і Meta кажуть це у власних доках. Блокувати їх - робота фаєрвола, а не robots.txt.
- Більшість великих вендорів тепер публікують список IP у JSON; Meta дає натомість номер AS, а Mistral покриває лише два боти з трьох. Перевіряйте за IP, ніколи за рядком User-Agent.
- У моєму скані 53 файлів robots.txt (26 серпня 2026) лише 6 сайтів повністю блокують хоч якогось AI-бота, 5 публікують рядок `Content-Signal`, а 2 досі тримають виведений з ужитку токен `anthropic-ai` поруч із чинною групою `ClaudeBot`.
- Наприкінці - три готові конфіги: дозволити все, заблокувати лише тренування, заблокувати весь AI.

## Що вважати AI-краулером

AI-краулер - це будь-який автоматичний клієнт, який завантажує вебсторінки для продукту на основі великої мовної моделі. Назва накриває три різні роботи, які вендори виконують окремими ботами з окремими правилами. Тренувальний краулер збирає текст, щоб навчити наступну модель. Пошуковий індексатор будує індекс, з якого відповідь дістає підкріплення й цитати. Завантажувач на запит користувача відкриває один URL, бо людина попросила асистента його прочитати.

Різниця важлива, бо політики вендорів різняться саме за роботою. Сторінка ботів OpenAI каже, що кожне з трьох її налаштувань robots.txt «незалежне від інших» ([OpenAI, Overview of OpenAI crawlers](https://developers.openai.com/api/docs/bots)). Документація Google ділить краулерів на «звичайних», які «завжди поважають правила robots.txt при автоматичному обході», і «завантажувачів на запит користувача», які «здебільшого ігнорують правила robots.txt» ([Google Search Central, user-triggered fetchers](https://developers.google.com/search/docs/crawling-indexing/google-user-triggered-fetchers)).

Дозволити бота - лише перша з чотирьох умов, і ця стаття вичерпно покриває саме першу. Якщо ви вже дозволили все й досі нічого не бачите, причина зазвичай далі по ланцюжку: [why your site doesn't show in ChatGPT and Perplexity](/blog/why-your-site-doesnt-show-in-chatgpt-and-perplexity) розбирає режими збою за порядком, а [the JavaScript trap](/blog/the-javascript-trap-why-ai-bots-see-empty-pages) - найпоширеніший із них, коли сторінка дозволена, завантажена й порожня, бо бот не виконує ваш JavaScript.

## Повний список AI-краулерів, за документами вендорів

Категорії: **T** - тренування моделі, **S** - пошуковий індекс або добування, **U** - завантаження на запит користувача, **O** - інше. «Поважає robots.txt» повторює власну заяву вендора; «немає доків» означає, що я не знайшов сторінки від першої особи, і запис тримається на списку спільноти [ai-robots-txt/ai.robots.txt](https://github.com/ai-robots-txt/ai.robots.txt).

| Токен user-agent | Власник | Тип | Поважає robots.txt | Список IP / перевірка |
|---|---|---|---|---|
| `GPTBot` | OpenAI | T | Так | [openai.com/gptbot.json](https://openai.com/gptbot.json) |
| `OAI-SearchBot` | OpenAI | S | Так | [openai.com/searchbot.json](https://openai.com/searchbot.json) |
| `ChatGPT-User` | OpenAI | U | Ні: «правила robots.txt можуть не діяти» | [openai.com/chatgpt-user.json](https://openai.com/chatgpt-user.json) |
| `OAI-AdsBot` | OpenAI | O (рекламні лендинги) | Не вказано | [openai.com/adsbot.json](https://openai.com/adsbot.json) |
| `ClaudeBot` | Anthropic | T | Так, плюс `Crawl-delay` | [claude.com/crawling/bots.json](https://claude.com/crawling/bots.json) |
| `Claude-User` | Anthropic | U | Так (заява вендора покриває всі три) | той самий файл |
| `Claude-SearchBot` | Anthropic | S | Так | той самий файл |
| `anthropic-ai`, `Claude-Web` | Anthropic | виведені з ужитку | Немає на чинній сторінці Anthropic | немає |
| `PerplexityBot` | Perplexity | S | Так | [perplexity.com/perplexitybot.json](https://www.perplexity.com/perplexitybot.json) |
| `Perplexity-User` | Perplexity | U | Ні: «здебільшого ігнорує правила robots.txt» | [perplexity.com/perplexity-user.json](https://www.perplexity.com/perplexity-user.json) |
| `Googlebot` | Google | S | Так | [common-crawlers.json](https://developers.google.com/static/crawling/ipranges/common-crawlers.json), rDNS `*.googlebot.com` |
| `Google-Extended` | Google | T (лише керівний токен) | Так | власного UA немає; обходить як Googlebot |
| `GoogleOther`, `GoogleOther-Image`, `GoogleOther-Video` | Google | O (дослідницькі завантаження) | Так | common-crawlers.json |
| `Google-CloudVertexBot` | Google | S (агенти Vertex AI) | Так | common-crawlers.json |
| `Google-Agent` | Google | U | Ні: «здебільшого ігнорують robots.txt» | [user-triggered-agents.json](https://developers.google.com/static/crawling/ipranges/user-triggered-agents.json) |
| `Google-GeminiNotebook` | Google | U (NotebookLM) | Ні | [user-triggered-fetchers.json](https://developers.google.com/static/crawling/ipranges/user-triggered-fetchers.json) |
| `bingbot` | Microsoft | S (живить і пошук ChatGPT) | Так, за довідкою Bing | bingbot.json на bing.com; довідкові сторінки Bing у мене не відкрилися 26 серпня 2026 |
| `Applebot` | Apple | S + T | Так, плюс `noindex`, `nosnippet`, `X-Robots-Tag: applebot:` | [applebot.json](https://search.developer.apple.com/applebot.json), rDNS `*.applebot.apple.com` |
| `Applebot-Extended` | Apple | T (керівний токен) | Так; «не обходить вебсторінки» | власного UA немає |
| `meta-externalagent` | Meta | T + S | Так | `whois -h whois.radb.net -- '-i origin AS32934'` |
| `meta-externalfetcher` | Meta | U | Ні: «може обходити правила robots.txt» | AS32934 |
| `meta-webindexer` | Meta | S (пошук Meta AI) | Так | AS32934 |
| `facebookexternalhit` | Meta | O (прев'ю посилань) | Частково | AS32934 |
| `Amazonbot` | Amazon | T + S | Так, плюс `noindex`, `noarchive` | [amazonbot/ip-addresses](https://developer.amazon.com/amazonbot/ip-addresses/) |
| `Amzn-SearchBot` | Amazon | S (без тренування) | Так | [searchbot-ip-addresses](https://developer.amazon.com/amazonbot/searchbot-ip-addresses/) |
| `Amzn-User` | Amazon | U (Alexa) | Перелічений під REP, без застережень | [live-ip-addresses](https://developer.amazon.com/amazonbot/live-ip-addresses/) |
| `MistralAI-Training` | Mistral | T | Так | немає: Mistral публікує списки IP лише для Index і User |
| `MistralAI-Index` | Mistral | S (без тренування) | Мається на увазі | [mistralai-index-ips.json](https://mistral.ai/mistralai-index-ips.json) |
| `MistralAI-User` | Mistral | U | Не вказано | [mistralai-user-ips.json](https://mistral.ai/mistralai-user-ips.json) |
| `DuckAssistBot` | DuckDuckGo | S/U (без тренування) | Так, застосовує протягом 72 годин | [duckassistbot.json](https://duckduckgo.com/duckassistbot.json) |
| `CCBot` | Common Crawl | T (відкритий корпус) | Так | [ccbot.json](https://index.commoncrawl.org/ccbot.json), rDNS `*.crawl.commoncrawl.org` |
| `Bytespider` | ByteDance | T | Доків немає; список спільноти каже ні | немає |
| `Diffbot`, `Diffbot-User` | Diffbot | O + U | Так за замовчуванням | немає |
| `omgili` / `omgilibot` | Webz.io | O (перепродаж даних) | Так | немає |
| `ImagesiftBot` | Hive | O (зображення) | Так, відкочується до правил Googlebot | немає |
| `YouBot` | You.com | S | Доків немає | немає |
| `cohere-ai`, `cohere-training-data-crawler` | Cohere | U / T | Доків немає | немає |
| `Timpibot` | Timpi | T | Доків немає | немає |

Два числа дають таблиці масштаб. Підтримуваний спільнотою `robots.json` на ai-robots-txt 26 серпня 2026 року містив 166 токенів, здебільшого дрібних або неперевірених операторів. Довідник Cloudflare AI Crawl Control перелічує 20 ботів, яких він може перевірити криптографічно або за IP, у групах AI Crawler, AI Search, AI Assistant і Search Engine ([Cloudflare, AI Crawl Control bots](https://developers.cloudflare.com/ai-crawl-control/reference/bots/)).

## Які AI-боти ігнорують robots.txt

Чотири боти у власній документації кажуть, що robots.txt може до них не застосовуватись, і всі чотири - завантажувачі на запит користувача. OpenAI: для ChatGPT-User «правила robots.txt можуть не діяти», бо дії ініціює користувач. Perplexity: Perplexity-User «здебільшого ігнорує правила robots.txt» ([Perplexity, Crawlers](https://docs.perplexity.ai/guides/bots)). Google: завантажувачі на запит користувача «здебільшого ігнорують правила robots.txt», бо «завантаження попросив користувач». Meta: meta-externalfetcher «може обходити правила robots.txt» ([Meta, Web crawlers](https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/)).

Логіка в усіх вендорів однакова: людина вставила ваш URL в асистента, тож завантаження трактують як візит браузера. Якщо вам треба спинити саме їх, robots.txt - не той інструмент. Беріть правило WAF або налаштування Cloudflare «Block AI bots», яке з липня 2026 року цілиться в три поведінки - Search, Agent і Training - і застосовується до «перевірених ботів з такою поведінкою плюс додаткових неперевірених» ([Cloudflare, Block AI bots](https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/)).

Anthropic - виняток серед великих вендорів: її сторінка каже, що «боти Anthropic поважають сигнали „не обходити“, шануючи галузеві стандартні директиви в robots.txt», і називає всі три боти, включно з Claude-User ([Anthropic, Does Anthropic crawl data from the web](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler)).

## Чи означає `noindex` щось для AI-краулерів

Для OpenAI й Anthropic - ні. Жодна зі сторінок про ботів не згадує метатеги robots чи `X-Robots-Tag`; обидві описують robots.txt як єдиний контроль. Я писав протилежне в [ранішій статті на цьому сайті](/uk/aeo/noindex-tag-shcho-hovaie-storinky) і виправив це там; чесна позиція така: `noindex` документують рівно два вендори, дотичні до AI. Apple заявляє, що Applebot поважає `noindex`, `nosnippet` («блокує генерацію опису й використання в AI-моделі як контексту»), `nofollow`, `none` і обмежений `X-Robots-Tag: applebot: nosnippet` ([Apple, About Applebot](https://support.apple.com/en-us/119829)). Amazon заявляє, що Amazonbot поважає `noarchive`, `noindex` і `none` ([Amazon, Amazonbot](https://developer.amazon.com/amazonbot)).

Є ще одна тонкість. Сторінку, заблоковану в robots.txt, ніхто не завантажує, тож `noindex` на ній ніхто й не побачить. Якщо ваша мета - «завантажуйте, але не цитуйте», robots.txt цього не висловлює; найближче до такого прохання - `nosnippet` від Apple і рядок `Content-Signal` нижче.

## Як перевірити краулера за IP

Рядок User-Agent - це вільний текст у заголовку. Будь-хто, хто парсить ваш сайт, може надіслати `Mozilla/5.0 (compatible; GPTBot/1.1)` і успадкувати всі дозволи, які ви дали OpenAI. Перевірка означає звірку IP джерела зі списком, який публікує вендор, і більшість великих тепер віддають його як JSON. Прогалини варто знати до того, як писати правило: Meta публікує номер AS замість файлу, а Mistral покриває `MistralAI-Index` і `MistralAI-User`, але не `MistralAI-Training`.

```bash
# scripts/verify-ai-bot.sh
# Usage: ./scripts/verify-ai-bot.sh <ip> <vendor>
# vendor: openai | anthropic | perplexity | google | apple | commoncrawl | mistral | duckduckgo
set -euo pipefail
ip="$1"; vendor="$2"
case "$vendor" in
  openai)      urls="https://openai.com/gptbot.json https://openai.com/searchbot.json https://openai.com/chatgpt-user.json" ;;
  anthropic)   urls="https://claude.com/crawling/bots.json" ;;
  perplexity)  urls="https://www.perplexity.com/perplexitybot.json https://www.perplexity.com/perplexity-user.json" ;;
  google)      urls="https://developers.google.com/static/crawling/ipranges/common-crawlers.json https://developers.google.com/static/crawling/ipranges/user-triggered-fetchers.json https://developers.google.com/static/crawling/ipranges/user-triggered-agents.json" ;;
  apple)       urls="https://search.developer.apple.com/applebot.json" ;;
  commoncrawl) urls="https://index.commoncrawl.org/ccbot.json" ;;
  mistral)     urls="https://mistral.ai/mistralai-index-ips.json https://mistral.ai/mistralai-user-ips.json" ;;
  duckduckgo)  urls="https://duckduckgo.com/duckassistbot.json" ;;
  *) echo "unknown vendor"; exit 2 ;;
esac
python3 - "$ip" $urls <<'PY'
import ipaddress, json, sys, urllib.request
ip = ipaddress.ip_address(sys.argv[1])
for url in sys.argv[2:]:
    data = json.load(urllib.request.urlopen(url, timeout=15))
    prefixes = []
    def walk(node):
        if isinstance(node, dict):
            for key, value in node.items():
                if key in ("ipv4Prefix", "ipv6Prefix", "prefix", "cidr") and isinstance(value, str):
                    prefixes.append(value)
                else:
                    walk(value)
        elif isinstance(node, list):
            for item in node:
                walk(item)
        elif isinstance(node, str) and "/" in node:
            prefixes.append(node)
    walk(data)
    for prefix in prefixes:
        try:
            if ip in ipaddress.ip_network(prefix, strict=False):
                print(f"MATCH {ip} in {prefix} ({url})")
                sys.exit(0)
        except ValueError:
            continue
print(f"NO MATCH for {ip}")
sys.exit(1)
PY
```

Скрипт обходить будь-яку з форм JSON у вендорів (OpenAI і Google використовують `prefixes[].ipv4Prefix`, Anthropic і Perplexity - пласкі списки) і виходить з кодом 0 при збігу. Meta не публікує JSON; беріть `whois -h whois.radb.net -- '-i origin AS32934' | grep ^route` і звіряйте з цими маршрутами. Google і Apple додатково підтримують зворотний DNS: справжній Googlebot резолвиться в `*.googlebot.com` або `*.geo.googlebot.com`, справжній Applebot - у `*.applebot.apple.com`.

Де б ви не хостились, найдешевше місце логувати кандидатів - той шар на краю або middleware, який у вашого фреймворку вже є: `middleware.ts` у застосунку на Next.js, або що там працює перед обробником маршруту деінде. Зіставляйте User-Agent із токенами вище, пишіть у лог запитів `ua`, `ip` і `path`, і щотижня проганяйте скрипт по цих IP. Той самий лог - сировина для того, щоб вимірювати AI-видимість, а не припускати її: [аудит AI-видимості вручну](/uk/aeo/audyt-ai-vydymosti-vruchnu) описує перевірки й ті числа, які цей сайт дав, коли прогнав їх по собі.

## Що насправді роблять 53 сайти: скан за серпень 2026

26 серпня 2026 року я завантажив `robots.txt` із 65 доменів: блоги інструментів AI-видимості й технічні SEO-сайти, що конкурують із цим; фреймворки й хости, які читає розробник (Vercel, Next.js, MDN, Cloudflare, Kinsta, WP Engine); добірка видань; і 12 українських агенцій, медіа й маркетплейсів. 53 файли виявились читабельними; 12 віддали HTML-обгортку, 403 або перевірку на бота і були виключені. «Блокує» нижче означає групу саме для цього токена з `Disallow: /`.

| Знахідка | Кількість | Частка з 53 |
|---|---|---|
| Повністю блокують щонайменше один AI-токен | 6 | 11,3% |
| Блокують `GPTBot` | 3 (medium.com, forbes.com, techcrunch.com) | 5,7% |
| Блокують `ClaudeBot` | 3 (ті самі три) | 5,7% |
| Блокують `Bytespider` | 4 | 7,5% |
| Блокують `Amazonbot` | 4 (medium.com, forbes.com, notion.so, dou.ua) | 7,5% |
| Блокують виведені з ужитку `anthropic-ai` або `Claude-Web` | 2 (forbes.com, techcrunch.com) | 3,8% |
| Публікують рядок `Content-Signal:` | 5 (vercel.com, kinsta.com, cloudflare.com, supabase.com, agent-ready.dev) | 9,4% |
| Блокують хоч якогось завантажувача на запит користувача (`ChatGPT-User`, `Perplexity-User`, `Claude-User`) | 1 (techcrunch.com блокує `ChatGPT-User`) | 1,9% |
| Українські домени (12 читабельних), що блокують хоч якийсь AI-токен | 1 (dou.ua, лише `Amazonbot`) | 8,3% з 12 |

Впадають в око три речі. Перше: блокування зосереджене у видань - medium.com блокує шість токенів, forbes.com девʼять, techcrunch.com девʼять. Кожен SEO-блог, кожен сайт фреймворку і кожна українська агенція у вибірці дозволяють усе; єдиний сайт для розробників, який щось блокує, - agent-ready.dev, і він блокує `CCBot` і `Bytespider`, явно лишаючи дозволеними пошукових ботів. Друге: поширення `Content-Signal` - історія про інфраструктуру, а не про редакційну політику: чотири з пʼяти сайтів, що його публікують (Vercel, Kinsta, Cloudflare, Supabase), - хостинг- або CDN-компанії, чий керований robots.txt додає цей рядок сам. Третє: techcrunch.com блокує `ChatGPT-User` і `Claude-Web`, з яких перший ігнорує robots.txt за власним визнанням OpenAI, а другого більше не існує.

Метод і межі: одне завантаження на домен звичайним HTTP-клієнтом; сайти, які віддають різний robots.txt різним user-agent, не перевірялись; 12 нечитабельних файлів зміщують вибірку геть від великих видань, а саме вони найімовірніше блокують. Сирий CSV - у посиланні наприкінці.

## Content-Signal і чернетка IETF: побажання за призначенням, а не за ботом

Модель «на кожного бота» не масштабується: 166 токенів у списку спільноти, і кожен новий продукт додає ще один. Два зусилля висловлюють побажання за сценарієм використання.

Керований robots.txt від Cloudflare додає рядок на кшталт `Content-Signal: search=yes, ai-train=no, use=reference`. У словнику три ключі: `search` для «побудови пошукового індексу й видачі результатів», `ai-input` для «подавання контенту в одну чи кілька AI-моделей (наприклад, RAG, підкріплення відповіді)» і `ai-train` для «тренування або донавчання AI-моделей». Дотримання добровільне ([Cloudflare, Managed robots.txt](https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/)).

Робоча група IETF AI Preferences стандартизує ту саму ідею. `draft-ietf-aipref-vocab-07` (19 серпня 2026) визначає `train-ai` і `search` зі значеннями `y`, `n` або невідомо, а `draft-ietf-aipref-attach-05` визначає HTTP-заголовок `Content-Usage` і правило в robots.txt - наприклад, `Content-Usage: train-ai=n` для всього сайту або `Content-Usage: /ai-ok/ train-ai=y` для шляху ([IETF, draft-ietf-aipref-attach](https://datatracker.ietf.org/doc/draft-ietf-aipref-attach/)). Чернетка прямо каже, що «побажання не є механізмом безпеки». Сьогодні жоден краулер нічого з цих двох документів не забезпечує примусово, але коштує це один рядок, і пʼять хостингових компаній з мого скану вже його віддають.

## Три готові robots.txt

Кожен варіант зберігає `Sitemap:` і правила для параметрів, які цей сайт уже використовує; свої `Disallow` для адмінських шляхів додавайте в групу `*`.

### Варіант 1: дозволити все й заявити свою позицію

Беріть його, якщо хочете цитувань від AI і згодні на тренування. Саме так працює alexturik.com.

```txt
# public/robots.txt
User-agent: *
Allow: /

Content-Signal: search=yes, ai-input=yes, ai-train=yes

Sitemap: https://example.com/sitemap.xml
```

### Варіант 2: заблокувати тренування, лишити пошук і асистентів

Беріть його, якщо хочете, щоб вас цитували пошук ChatGPT, Perplexity, Claude і AI-функції Google, але не хочете потрапити в наступний тренувальний набір. Токени нижче - це суто тренувальні боти й керівні токени; пошукові й запущені користувачем лишаються дозволеними групою `*`.

```txt
# public/robots.txt
User-agent: *
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: MistralAI-Training
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: cohere-training-data-crawler
Disallow: /

User-agent: Timpibot
Disallow: /

Content-Signal: search=yes, ai-input=yes, ai-train=no

Sitemap: https://example.com/sitemap.xml
```

Два застереження. `meta-externalagent` і `Amazonbot` і тренують, і індексують, тож блокування прибирає вас із пошуку Meta AI і відповідей Alexa; `Amzn-SearchBot` від Amazon лишається дозволеним і не тренує. `Applebot-Extended` блокує тренування, лишаючи Siri й пошук Spotlight на `Applebot`.

### Варіант 3: заблокувати всіх задокументованих AI-ботів

Беріть його, тільки якщо вирішили, що AI-трафік не має для вас цінності. Памʼятайте: чотири завантажувачі на запит користувача все одно відкриють сторінку, коли попросить людина; спинити їх можна лише правилом фаєрвола.

```txt
# public/robots.txt
User-agent: *
Allow: /

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Google-CloudVertexBot
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: meta-externalfetcher
User-agent: meta-webindexer
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: MistralAI-Training
User-agent: MistralAI-Index
User-agent: MistralAI-User
User-agent: DuckAssistBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Diffbot
User-agent: omgili
User-agent: ImagesiftBot
User-agent: YouBot
User-agent: cohere-ai
User-agent: cohere-training-data-crawler
User-agent: Timpibot
Disallow: /

Content-Signal: search=no, ai-input=no, ai-train=no

Sitemap: https://example.com/sitemap.xml
```

Складені підряд рядки `User-agent` в одній групі валідні за RFC 9309, розділ 2.2.1, і кожен перелічений вище парсер їх підтримує ([RFC 9309, Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html)). `Googlebot`, `bingbot` і `Applebot` у варіанті 3 свідомо відсутні: блокування прибирає вас із класичного пошуку, а «заблокувати AI» зазвичай означає не це.

## Як перевірити результат

Після деплою переконайтесь, що файл парситься так, як ви думаєте. Звіт robots.txt у Google Search Console показує завантажений файл і помилки розбору. Для конкретного бота найшвидша перевірка - пошук групи через curl і awk:

```bash
# scripts/robots-check.sh
# Usage: ./scripts/robots-check.sh https://example.com GPTBot
set -euo pipefail
site="$1"; bot="$(echo "$2" | tr 'A-Z' 'a-z')"
curl -sL "$site/robots.txt" | awk -v bot="$bot" '
  BEGIN { ing = 0 }
  /^[ \t]*[Uu]ser-[Aa]gent:/ {
    ua = tolower($0); sub(/^[ \t]*user-agent:[ \t]*/, "", ua); gsub(/[ \t\r]+$/, "", ua)
    if (ua == bot) { ing = 1; print "group: " $0 } else if (!prev) { ing = 0 }
    prev = 1; next
  }
  { prev = 0 }
  ing && /^[ \t]*([Dd]isallow|[Aa]llow|[Cc]rawl-delay):/ { print "  " $0 }
'
```

Проженіть його по своєму продакшн-URL для кожного доданого токена. Якщо він нічого не друкує, групи немає або вона з друкарською помилкою; найчастіші помилки у файлах, які я сканував, - `GPTbot`, `Claude-bot` і `Perplexity Bot` із пробілом.

Браузерна версія того самого питання: розширення [AEO Checker](/extensions/aeo-checker) перевіряє robots.txt відкритої вкладки однією з девʼяти своїх перевірок, і це швидший спосіб подивитись на чужий сайт. Його обсяг свідомо вужчий за цю статтю: десять токенів, чотири в реальному часі й шість тренувальних, згорнуті в один вердикт «пройдено/попередження/провал», а не роздруковані по групах. Він також досі тримає в тому списку `anthropic-ai`, який таблиця вище позначає виведеним з ужитку. Це застарілий запис, який я розширенню винен, і водночас гарна ілюстрація того, як швидко старіє захардкоджений список ботів.

## Історія змін

- 2026-08-27: перша версія. 44 токени в 38 рядках таблиці, скан 53 сайтів, Content-Signal і `draft-ietf-aipref-attach-05` від IETF.

## FAQ

### Які AI-краулери ігнорують robots.txt

За власною документацією: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Google-Agent та інші завантажувачі Google на запит користувача, і meta-externalfetcher (Meta). Усі чотири - завантажувачі на запит користувача: людина попросила асистента відкрити ваш URL, тож вендор трактує запит як користувацький, а не ботівський. Тренувальні й пошукові краулери тих самих вендорів robots.txt поважають.

### Чи прибере блокування GPTBot мій сайт із пошуку ChatGPT

Ні. OpenAI тримає три окремі боти з незалежними правилами. GPTBot відповідає за тренування, OAI-SearchBot - за відповіді пошуку ChatGPT, а ChatGPT-User завантажує сторінки на запит користувача. Блокування самого лише GPTBot лишає вас придатними для цитувань у пошуку; блокування OAI-SearchBot прибирає вас із пошукових відповідей, але не з навігаційних посилань.

### Як переконатися, що запит справді прийшов від GPTBot чи ClaudeBot

Звірте IP запиту з опублікованими діапазонами вендора. OpenAI віддає openai.com/gptbot.json, Anthropic - claude.com/crawling/bots.json, Perplexity - perplexity.com/perplexitybot.json, Google публікує файли JSON під developers.google.com/static/crawling/ipranges/. Сам лише рядок User-Agent не доводить нічого: його може надіслати будь-який скрипт.

### Чи є Google-Extended краулером

Ні. У Google-Extended немає власного рядка user-agent. Це керівний токен для robots.txt: обхід і далі виконує Googlebot, а `Disallow` для Google-Extended каже Google не використовувати завантажений контент для тренування майбутніх моделей Gemini чи для підкріплення відповідей у Gemini Apps і Vertex AI. На потрапляння в пошук Google це не впливає.

### Що таке Content-Signal у robots.txt

Рядок, який додає керований robots.txt від Cloudflare, наприклад `Content-Signal: search=yes, ai-train=no, use=reference`. Він виражає побажання за сценарієм використання, а не за ботом. Дотримання добровільне, а IETF стандартизує споріднений словник (`train-ai`, `search`) у робочій групі AI Preferences. У моєму скані за серпень 2026 його публікували 5 із 53 сайтів.

### Як часто оновлювати список AI-краулерів у robots.txt

Перевіряйте щокварталу. Між 2024 і 2026 роками Anthropic вивела з ужитку anthropic-ai і Claude-Web та додала Claude-User і Claude-SearchBot; OpenAI додала OAI-SearchBot і OAI-AdsBot; Mistral додала три боти. Два з 53 просканованих сайтів досі тримають виведений токен `anthropic-ai`; обидва блокують і `ClaudeBot`, тож застарілий рядок лише додає шуму. А от файл, у якому стоїть сам `anthropic-ai`, не блокував би нічого з того, що Anthropic запускає сьогодні.

## Джерела

- [OpenAI, Overview of OpenAI crawlers](https://developers.openai.com/api/docs/bots) - три боти й заява, що кожне налаштування robots.txt незалежне
- [Anthropic, Does Anthropic crawl data from the web](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) - три чинні токени й зобовʼязання, що покриває всіх
- [Perplexity, Crawlers](https://docs.perplexity.ai/guides/bots) - PerplexityBot проти Perplexity-User
- [Google Search Central, Google common crawlers](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)
- [Google Search Central, User-triggered fetchers](https://developers.google.com/search/docs/crawling-indexing/google-user-triggered-fetchers) - звідки взято «здебільшого ігнорують правила robots.txt»
- [Google Search Central, Verifying Googlebot](https://developers.google.com/search/docs/crawling-indexing/verifying-googlebot) - метод зворотного DNS і діапазонів IP
- [Apple, About Applebot](https://support.apple.com/en-us/119829) - єдина сторінка вендора, яка документує `noindex` і `nosnippet` для AI-краулера
- [Meta, Web crawlers](https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/)
- [Amazon, Amazonbot](https://developer.amazon.com/amazonbot) - друга така
- [Mistral, Robots](https://docs.mistral.ai/robots/)
- [DuckDuckGo, DuckAssistBot](https://duckduckgo.com/duckduckgo-help-pages/results/duckassistbot/)
- [Common Crawl, CCBot](https://commoncrawl.org/ccbot)
- [Diffbot, robots.txt FAQ](https://www.diffbot.com/docs/crawl/faq/robots-txt)
- [Cloudflare, AI Crawl Control bots reference](https://developers.cloudflare.com/ai-crawl-control/reference/bots/) - 20 ботів, яких Cloudflare може перевірити
- [Cloudflare, Block AI bots](https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/) - відповідь фаєрвола на завантажувачів за запитом користувача
- [Cloudflare, Managed robots.txt and Content Signals](https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/) - словник `Content-Signal`
- [IETF, draft-ietf-aipref-vocab](https://datatracker.ietf.org/doc/draft-ietf-aipref-vocab/)
- [IETF, draft-ietf-aipref-attach](https://datatracker.ietf.org/doc/draft-ietf-aipref-attach/) - заголовок `Content-Usage` і правило в robots.txt
- [IETF, RFC 9309 Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html) - розділ 2.2.1 про складені рядки `User-agent`
- [Список спільноти ai-robots-txt](https://github.com/ai-robots-txt/ai.robots.txt) - список на 166 токенів і єдине джерело для семи токенів без сторінки вендора
- [Сирі дані скану](/aeo/robots-scan-2026-08.csv) - усі 65 доменів, завантажених 26 серпня 2026 року, по рядку на кожен

Частина кластера [Answer Engine Optimization](/uk/aeo) - повний порядок читання і [глосарій](/uk/aeo/glossary) усіх термінів, що трапляються в цих статтях.
