← Oleksii Turovskyi

Список AI-краулерів 2026: user-agent і robots.txt по ботах

· 18 хв читання · Оновлено

In English: AI Crawler List 2026: Every User-Agent, robots.txt per Botread in English

Станом на 26 серпня 2026 року варто знати сорок чотири токени user-agent, повʼязані з AI, і чотири вендори у власній документації заявляють, що частина їхніх ботів ігнорує robots.txt. Тридцять сім із сорока чотирьох мають сторінку від першої особи; решта сім, дві з яких Anthropic вивела з ужитку, тримаються на списку спільноти. Повна таблиця нижче, за вендорами, зі списком IP для перевірки кожного. Спершу - що означають категорії, бо «заблокувати AI» - це три різні рішення.

Коротко#

  • AI-боти бувають трьох видів: тренувальні краулери, пошукові індексатори і завантажувачі на запит користувача. Кожен вендор документує їх окремо й дозволяє дозволяти чи блокувати кожного незалежно.
  • Завантажувачі на запит користувача здебільшого не поважають robots.txt. OpenAI, Perplexity, Google і Meta кажуть це у власних доках. Блокувати їх - робота фаєрвола, а не robots.txt.
  • Більшість великих вендорів тепер публікують список IP у JSON; Meta дає натомість номер AS, а Mistral покриває лише два боти з трьох. Перевіряйте за IP, ніколи за рядком User-Agent.
  • У моєму скані 53 файлів robots.txt (26 серпня 2026) лише 6 сайтів повністю блокують хоч якогось AI-бота, 5 публікують рядок Content-Signal, а 2 досі тримають виведений з ужитку токен anthropic-ai поруч із чинною групою ClaudeBot.
  • Наприкінці - три готові конфіги: дозволити все, заблокувати лише тренування, заблокувати весь AI.

Що вважати AI-краулером#

AI-краулер - це будь-який автоматичний клієнт, який завантажує вебсторінки для продукту на основі великої мовної моделі. Назва накриває три різні роботи, які вендори виконують окремими ботами з окремими правилами. Тренувальний краулер збирає текст, щоб навчити наступну модель. Пошуковий індексатор будує індекс, з якого відповідь дістає підкріплення й цитати. Завантажувач на запит користувача відкриває один URL, бо людина попросила асистента його прочитати.

Різниця важлива, бо політики вендорів різняться саме за роботою. Сторінка ботів OpenAI каже, що кожне з трьох її налаштувань robots.txt «незалежне від інших» (OpenAI, Overview of OpenAI crawlers). Документація Google ділить краулерів на «звичайних», які «завжди поважають правила robots.txt при автоматичному обході», і «завантажувачів на запит користувача», які «здебільшого ігнорують правила robots.txt» (Google Search Central, user-triggered fetchers).

Дозволити бота - лише перша з чотирьох умов, і ця стаття вичерпно покриває саме першу. Якщо ви вже дозволили все й досі нічого не бачите, причина зазвичай далі по ланцюжку: why your site doesn't show in ChatGPT and Perplexity розбирає режими збою за порядком, а the JavaScript trap - найпоширеніший із них, коли сторінка дозволена, завантажена й порожня, бо бот не виконує ваш JavaScript.

Повний список AI-краулерів, за документами вендорів#

Категорії: T - тренування моделі, S - пошуковий індекс або добування, U - завантаження на запит користувача, O - інше. «Поважає robots.txt» повторює власну заяву вендора; «немає доків» означає, що я не знайшов сторінки від першої особи, і запис тримається на списку спільноти ai-robots-txt/ai.robots.txt.

Токен user-agent Власник Тип Поважає robots.txt Список IP / перевірка
GPTBot OpenAI T Так openai.com/gptbot.json
OAI-SearchBot OpenAI S Так openai.com/searchbot.json
ChatGPT-User OpenAI U Ні: «правила robots.txt можуть не діяти» openai.com/chatgpt-user.json
OAI-AdsBot OpenAI O (рекламні лендинги) Не вказано openai.com/adsbot.json
ClaudeBot Anthropic T Так, плюс Crawl-delay claude.com/crawling/bots.json
Claude-User Anthropic U Так (заява вендора покриває всі три) той самий файл
Claude-SearchBot Anthropic S Так той самий файл
anthropic-ai, Claude-Web Anthropic виведені з ужитку Немає на чинній сторінці Anthropic немає
PerplexityBot Perplexity S Так perplexity.com/perplexitybot.json
Perplexity-User Perplexity U Ні: «здебільшого ігнорує правила robots.txt» perplexity.com/perplexity-user.json
Googlebot Google S Так common-crawlers.json, rDNS *.googlebot.com
Google-Extended Google T (лише керівний токен) Так власного UA немає; обходить як Googlebot
GoogleOther, GoogleOther-Image, GoogleOther-Video Google O (дослідницькі завантаження) Так common-crawlers.json
Google-CloudVertexBot Google S (агенти Vertex AI) Так common-crawlers.json
Google-Agent Google U Ні: «здебільшого ігнорують robots.txt» user-triggered-agents.json
Google-GeminiNotebook Google U (NotebookLM) Ні user-triggered-fetchers.json
bingbot Microsoft S (живить і пошук ChatGPT) Так, за довідкою Bing bingbot.json на bing.com; довідкові сторінки Bing у мене не відкрилися 26 серпня 2026
Applebot Apple S + T Так, плюс noindex, nosnippet, X-Robots-Tag: applebot: applebot.json, rDNS *.applebot.apple.com
Applebot-Extended Apple T (керівний токен) Так; «не обходить вебсторінки» власного UA немає
meta-externalagent Meta T + S Так whois -h whois.radb.net -- '-i origin AS32934'
meta-externalfetcher Meta U Ні: «може обходити правила robots.txt» AS32934
meta-webindexer Meta S (пошук Meta AI) Так AS32934
facebookexternalhit Meta O (прев'ю посилань) Частково AS32934
Amazonbot Amazon T + S Так, плюс noindex, noarchive amazonbot/ip-addresses
Amzn-SearchBot Amazon S (без тренування) Так searchbot-ip-addresses
Amzn-User Amazon U (Alexa) Перелічений під REP, без застережень live-ip-addresses
MistralAI-Training Mistral T Так немає: Mistral публікує списки IP лише для Index і User
MistralAI-Index Mistral S (без тренування) Мається на увазі mistralai-index-ips.json
MistralAI-User Mistral U Не вказано mistralai-user-ips.json
DuckAssistBot DuckDuckGo S/U (без тренування) Так, застосовує протягом 72 годин duckassistbot.json
CCBot Common Crawl T (відкритий корпус) Так ccbot.json, rDNS *.crawl.commoncrawl.org
Bytespider ByteDance T Доків немає; список спільноти каже ні немає
Diffbot, Diffbot-User Diffbot O + U Так за замовчуванням немає
omgili / omgilibot Webz.io O (перепродаж даних) Так немає
ImagesiftBot Hive O (зображення) Так, відкочується до правил Googlebot немає
YouBot You.com S Доків немає немає
cohere-ai, cohere-training-data-crawler Cohere U / T Доків немає немає
Timpibot Timpi T Доків немає немає

Два числа дають таблиці масштаб. Підтримуваний спільнотою robots.json на ai-robots-txt 26 серпня 2026 року містив 166 токенів, здебільшого дрібних або неперевірених операторів. Довідник Cloudflare AI Crawl Control перелічує 20 ботів, яких він може перевірити криптографічно або за IP, у групах AI Crawler, AI Search, AI Assistant і Search Engine (Cloudflare, AI Crawl Control bots).

Які AI-боти ігнорують robots.txt#

Чотири боти у власній документації кажуть, що robots.txt може до них не застосовуватись, і всі чотири - завантажувачі на запит користувача. OpenAI: для ChatGPT-User «правила robots.txt можуть не діяти», бо дії ініціює користувач. Perplexity: Perplexity-User «здебільшого ігнорує правила robots.txt» (Perplexity, Crawlers). Google: завантажувачі на запит користувача «здебільшого ігнорують правила robots.txt», бо «завантаження попросив користувач». Meta: meta-externalfetcher «може обходити правила robots.txt» (Meta, Web crawlers).

Логіка в усіх вендорів однакова: людина вставила ваш URL в асистента, тож завантаження трактують як візит браузера. Якщо вам треба спинити саме їх, robots.txt - не той інструмент. Беріть правило WAF або налаштування Cloudflare «Block AI bots», яке з липня 2026 року цілиться в три поведінки - Search, Agent і Training - і застосовується до «перевірених ботів з такою поведінкою плюс додаткових неперевірених» (Cloudflare, Block AI bots).

Anthropic - виняток серед великих вендорів: її сторінка каже, що «боти Anthropic поважають сигнали „не обходити“, шануючи галузеві стандартні директиви в robots.txt», і називає всі три боти, включно з Claude-User (Anthropic, Does Anthropic crawl data from the web).

Чи означає noindex щось для AI-краулерів#

Для OpenAI й Anthropic - ні. Жодна зі сторінок про ботів не згадує метатеги robots чи X-Robots-Tag; обидві описують robots.txt як єдиний контроль. Я писав протилежне в ранішій статті на цьому сайті і виправив це там; чесна позиція така: noindex документують рівно два вендори, дотичні до AI. Apple заявляє, що Applebot поважає noindex, nosnippet («блокує генерацію опису й використання в AI-моделі як контексту»), nofollow, none і обмежений X-Robots-Tag: applebot: nosnippet (Apple, About Applebot). Amazon заявляє, що Amazonbot поважає noarchive, noindex і none (Amazon, Amazonbot).

Є ще одна тонкість. Сторінку, заблоковану в robots.txt, ніхто не завантажує, тож noindex на ній ніхто й не побачить. Якщо ваша мета - «завантажуйте, але не цитуйте», robots.txt цього не висловлює; найближче до такого прохання - nosnippet від Apple і рядок Content-Signal нижче.

Як перевірити краулера за IP#

Рядок User-Agent - це вільний текст у заголовку. Будь-хто, хто парсить ваш сайт, може надіслати Mozilla/5.0 (compatible; GPTBot/1.1) і успадкувати всі дозволи, які ви дали OpenAI. Перевірка означає звірку IP джерела зі списком, який публікує вендор, і більшість великих тепер віддають його як JSON. Прогалини варто знати до того, як писати правило: Meta публікує номер AS замість файлу, а Mistral покриває MistralAI-Index і MistralAI-User, але не MistralAI-Training.

# scripts/verify-ai-bot.sh
# Usage: ./scripts/verify-ai-bot.sh <ip> <vendor>
# vendor: openai | anthropic | perplexity | google | apple | commoncrawl | mistral | duckduckgo
set -euo pipefail
ip="$1"; vendor="$2"
case "$vendor" in
  openai)      urls="https://openai.com/gptbot.json https://openai.com/searchbot.json https://openai.com/chatgpt-user.json" ;;
  anthropic)   urls="https://claude.com/crawling/bots.json" ;;
  perplexity)  urls="https://www.perplexity.com/perplexitybot.json https://www.perplexity.com/perplexity-user.json" ;;
  google)      urls="https://developers.google.com/static/crawling/ipranges/common-crawlers.json https://developers.google.com/static/crawling/ipranges/user-triggered-fetchers.json https://developers.google.com/static/crawling/ipranges/user-triggered-agents.json" ;;
  apple)       urls="https://search.developer.apple.com/applebot.json" ;;
  commoncrawl) urls="https://index.commoncrawl.org/ccbot.json" ;;
  mistral)     urls="https://mistral.ai/mistralai-index-ips.json https://mistral.ai/mistralai-user-ips.json" ;;
  duckduckgo)  urls="https://duckduckgo.com/duckassistbot.json" ;;
  *) echo "unknown vendor"; exit 2 ;;
esac
python3 - "$ip" $urls <<'PY'
import ipaddress, json, sys, urllib.request
ip = ipaddress.ip_address(sys.argv[1])
for url in sys.argv[2:]:
    data = json.load(urllib.request.urlopen(url, timeout=15))
    prefixes = []
    def walk(node):
        if isinstance(node, dict):
            for key, value in node.items():
                if key in ("ipv4Prefix", "ipv6Prefix", "prefix", "cidr") and isinstance(value, str):
                    prefixes.append(value)
                else:
                    walk(value)
        elif isinstance(node, list):
            for item in node:
                walk(item)
        elif isinstance(node, str) and "/" in node:
            prefixes.append(node)
    walk(data)
    for prefix in prefixes:
        try:
            if ip in ipaddress.ip_network(prefix, strict=False):
                print(f"MATCH {ip} in {prefix} ({url})")
                sys.exit(0)
        except ValueError:
            continue
print(f"NO MATCH for {ip}")
sys.exit(1)
PY

Скрипт обходить будь-яку з форм JSON у вендорів (OpenAI і Google використовують prefixes[].ipv4Prefix, Anthropic і Perplexity - пласкі списки) і виходить з кодом 0 при збігу. Meta не публікує JSON; беріть whois -h whois.radb.net -- '-i origin AS32934' | grep ^route і звіряйте з цими маршрутами. Google і Apple додатково підтримують зворотний DNS: справжній Googlebot резолвиться в *.googlebot.com або *.geo.googlebot.com, справжній Applebot - у *.applebot.apple.com.

Де б ви не хостились, найдешевше місце логувати кандидатів - той шар на краю або middleware, який у вашого фреймворку вже є: middleware.ts у застосунку на Next.js, або що там працює перед обробником маршруту деінде. Зіставляйте User-Agent із токенами вище, пишіть у лог запитів ua, ip і path, і щотижня проганяйте скрипт по цих IP. Той самий лог - сировина для того, щоб вимірювати AI-видимість, а не припускати її: аудит AI-видимості вручну описує перевірки й ті числа, які цей сайт дав, коли прогнав їх по собі.

Що насправді роблять 53 сайти: скан за серпень 2026#

26 серпня 2026 року я завантажив robots.txt із 65 доменів: блоги інструментів AI-видимості й технічні SEO-сайти, що конкурують із цим; фреймворки й хости, які читає розробник (Vercel, Next.js, MDN, Cloudflare, Kinsta, WP Engine); добірка видань; і 12 українських агенцій, медіа й маркетплейсів. 53 файли виявились читабельними; 12 віддали HTML-обгортку, 403 або перевірку на бота і були виключені. «Блокує» нижче означає групу саме для цього токена з Disallow: /.

Знахідка Кількість Частка з 53
Повністю блокують щонайменше один AI-токен 6 11,3%
Блокують GPTBot 3 (medium.com, forbes.com, techcrunch.com) 5,7%
Блокують ClaudeBot 3 (ті самі три) 5,7%
Блокують Bytespider 4 7,5%
Блокують Amazonbot 4 (medium.com, forbes.com, notion.so, dou.ua) 7,5%
Блокують виведені з ужитку anthropic-ai або Claude-Web 2 (forbes.com, techcrunch.com) 3,8%
Публікують рядок Content-Signal: 5 (vercel.com, kinsta.com, cloudflare.com, supabase.com, agent-ready.dev) 9,4%
Блокують хоч якогось завантажувача на запит користувача (ChatGPT-User, Perplexity-User, Claude-User) 1 (techcrunch.com блокує ChatGPT-User) 1,9%
Українські домени (12 читабельних), що блокують хоч якийсь AI-токен 1 (dou.ua, лише Amazonbot) 8,3% з 12

Впадають в око три речі. Перше: блокування зосереджене у видань - medium.com блокує шість токенів, forbes.com девʼять, techcrunch.com девʼять. Кожен SEO-блог, кожен сайт фреймворку і кожна українська агенція у вибірці дозволяють усе; єдиний сайт для розробників, який щось блокує, - agent-ready.dev, і він блокує CCBot і Bytespider, явно лишаючи дозволеними пошукових ботів. Друге: поширення Content-Signal - історія про інфраструктуру, а не про редакційну політику: чотири з пʼяти сайтів, що його публікують (Vercel, Kinsta, Cloudflare, Supabase), - хостинг- або CDN-компанії, чий керований robots.txt додає цей рядок сам. Третє: techcrunch.com блокує ChatGPT-User і Claude-Web, з яких перший ігнорує robots.txt за власним визнанням OpenAI, а другого більше не існує.

Метод і межі: одне завантаження на домен звичайним HTTP-клієнтом; сайти, які віддають різний robots.txt різним user-agent, не перевірялись; 12 нечитабельних файлів зміщують вибірку геть від великих видань, а саме вони найімовірніше блокують. Сирий CSV - у посиланні наприкінці.

Content-Signal і чернетка IETF: побажання за призначенням, а не за ботом#

Модель «на кожного бота» не масштабується: 166 токенів у списку спільноти, і кожен новий продукт додає ще один. Два зусилля висловлюють побажання за сценарієм використання.

Керований robots.txt від Cloudflare додає рядок на кшталт Content-Signal: search=yes, ai-train=no, use=reference. У словнику три ключі: search для «побудови пошукового індексу й видачі результатів», ai-input для «подавання контенту в одну чи кілька AI-моделей (наприклад, RAG, підкріплення відповіді)» і ai-train для «тренування або донавчання AI-моделей». Дотримання добровільне (Cloudflare, Managed robots.txt).

Робоча група IETF AI Preferences стандартизує ту саму ідею. draft-ietf-aipref-vocab-07 (19 серпня 2026) визначає train-ai і search зі значеннями y, n або невідомо, а draft-ietf-aipref-attach-05 визначає HTTP-заголовок Content-Usage і правило в robots.txt - наприклад, Content-Usage: train-ai=n для всього сайту або Content-Usage: /ai-ok/ train-ai=y для шляху (IETF, draft-ietf-aipref-attach). Чернетка прямо каже, що «побажання не є механізмом безпеки». Сьогодні жоден краулер нічого з цих двох документів не забезпечує примусово, але коштує це один рядок, і пʼять хостингових компаній з мого скану вже його віддають.

Три готові robots.txt#

Кожен варіант зберігає Sitemap: і правила для параметрів, які цей сайт уже використовує; свої Disallow для адмінських шляхів додавайте в групу *.

Варіант 1: дозволити все й заявити свою позицію#

Беріть його, якщо хочете цитувань від AI і згодні на тренування. Саме так працює alexturik.com.

# public/robots.txt
User-agent: *
Allow: /
 
Content-Signal: search=yes, ai-input=yes, ai-train=yes
 
Sitemap: https://example.com/sitemap.xml

Варіант 2: заблокувати тренування, лишити пошук і асистентів#

Беріть його, якщо хочете, щоб вас цитували пошук ChatGPT, Perplexity, Claude і AI-функції Google, але не хочете потрапити в наступний тренувальний набір. Токени нижче - це суто тренувальні боти й керівні токени; пошукові й запущені користувачем лишаються дозволеними групою *.

# public/robots.txt
User-agent: *
Allow: /
 
User-agent: GPTBot
Disallow: /
 
User-agent: ClaudeBot
Disallow: /
 
User-agent: Google-Extended
Disallow: /
 
User-agent: Applebot-Extended
Disallow: /
 
User-agent: meta-externalagent
Disallow: /
 
User-agent: Amazonbot
Disallow: /
 
User-agent: MistralAI-Training
Disallow: /
 
User-agent: CCBot
Disallow: /
 
User-agent: Bytespider
Disallow: /
 
User-agent: cohere-training-data-crawler
Disallow: /
 
User-agent: Timpibot
Disallow: /
 
Content-Signal: search=yes, ai-input=yes, ai-train=no
 
Sitemap: https://example.com/sitemap.xml

Два застереження. meta-externalagent і Amazonbot і тренують, і індексують, тож блокування прибирає вас із пошуку Meta AI і відповідей Alexa; Amzn-SearchBot від Amazon лишається дозволеним і не тренує. Applebot-Extended блокує тренування, лишаючи Siri й пошук Spotlight на Applebot.

Варіант 3: заблокувати всіх задокументованих AI-ботів#

Беріть його, тільки якщо вирішили, що AI-трафік не має для вас цінності. Памʼятайте: чотири завантажувачі на запит користувача все одно відкриють сторінку, коли попросить людина; спинити їх можна лише правилом фаєрвола.

# public/robots.txt
User-agent: *
Allow: /
 
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Google-CloudVertexBot
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: meta-externalfetcher
User-agent: meta-webindexer
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: MistralAI-Training
User-agent: MistralAI-Index
User-agent: MistralAI-User
User-agent: DuckAssistBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Diffbot
User-agent: omgili
User-agent: ImagesiftBot
User-agent: YouBot
User-agent: cohere-ai
User-agent: cohere-training-data-crawler
User-agent: Timpibot
Disallow: /
 
Content-Signal: search=no, ai-input=no, ai-train=no
 
Sitemap: https://example.com/sitemap.xml

Складені підряд рядки User-agent в одній групі валідні за RFC 9309, розділ 2.2.1, і кожен перелічений вище парсер їх підтримує (RFC 9309, Robots Exclusion Protocol). Googlebot, bingbot і Applebot у варіанті 3 свідомо відсутні: блокування прибирає вас із класичного пошуку, а «заблокувати AI» зазвичай означає не це.

Як перевірити результат#

Після деплою переконайтесь, що файл парситься так, як ви думаєте. Звіт robots.txt у Google Search Console показує завантажений файл і помилки розбору. Для конкретного бота найшвидша перевірка - пошук групи через curl і awk:

# scripts/robots-check.sh
# Usage: ./scripts/robots-check.sh https://example.com GPTBot
set -euo pipefail
site="$1"; bot="$(echo "$2" | tr 'A-Z' 'a-z')"
curl -sL "$site/robots.txt" | awk -v bot="$bot" '
  BEGIN { ing = 0 }
  /^[ \t]*[Uu]ser-[Aa]gent:/ {
    ua = tolower($0); sub(/^[ \t]*user-agent:[ \t]*/, "", ua); gsub(/[ \t\r]+$/, "", ua)
    if (ua == bot) { ing = 1; print "group: " $0 } else if (!prev) { ing = 0 }
    prev = 1; next
  }
  { prev = 0 }
  ing && /^[ \t]*([Dd]isallow|[Aa]llow|[Cc]rawl-delay):/ { print "  " $0 }
'

Проженіть його по своєму продакшн-URL для кожного доданого токена. Якщо він нічого не друкує, групи немає або вона з друкарською помилкою; найчастіші помилки у файлах, які я сканував, - GPTbot, Claude-bot і Perplexity Bot із пробілом.

Браузерна версія того самого питання: розширення AEO Checker перевіряє robots.txt відкритої вкладки однією з девʼяти своїх перевірок, і це швидший спосіб подивитись на чужий сайт. Його обсяг свідомо вужчий за цю статтю: десять токенів, чотири в реальному часі й шість тренувальних, згорнуті в один вердикт «пройдено/попередження/провал», а не роздруковані по групах. Він також досі тримає в тому списку anthropic-ai, який таблиця вище позначає виведеним з ужитку. Це застарілий запис, який я розширенню винен, і водночас гарна ілюстрація того, як швидко старіє захардкоджений список ботів.

Історія змін#

  • 2026-08-27: перша версія. 44 токени в 38 рядках таблиці, скан 53 сайтів, Content-Signal і draft-ietf-aipref-attach-05 від IETF.

FAQ#

Які AI-краулери ігнорують robots.txt#

За власною документацією: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Google-Agent та інші завантажувачі Google на запит користувача, і meta-externalfetcher (Meta). Усі чотири - завантажувачі на запит користувача: людина попросила асистента відкрити ваш URL, тож вендор трактує запит як користувацький, а не ботівський. Тренувальні й пошукові краулери тих самих вендорів robots.txt поважають.

Чи прибере блокування GPTBot мій сайт із пошуку ChatGPT#

Ні. OpenAI тримає три окремі боти з незалежними правилами. GPTBot відповідає за тренування, OAI-SearchBot - за відповіді пошуку ChatGPT, а ChatGPT-User завантажує сторінки на запит користувача. Блокування самого лише GPTBot лишає вас придатними для цитувань у пошуку; блокування OAI-SearchBot прибирає вас із пошукових відповідей, але не з навігаційних посилань.

Як переконатися, що запит справді прийшов від GPTBot чи ClaudeBot#

Звірте IP запиту з опублікованими діапазонами вендора. OpenAI віддає openai.com/gptbot.json, Anthropic - claude.com/crawling/bots.json, Perplexity - perplexity.com/perplexitybot.json, Google публікує файли JSON під developers.google.com/static/crawling/ipranges/. Сам лише рядок User-Agent не доводить нічого: його може надіслати будь-який скрипт.

Чи є Google-Extended краулером#

Ні. У Google-Extended немає власного рядка user-agent. Це керівний токен для robots.txt: обхід і далі виконує Googlebot, а Disallow для Google-Extended каже Google не використовувати завантажений контент для тренування майбутніх моделей Gemini чи для підкріплення відповідей у Gemini Apps і Vertex AI. На потрапляння в пошук Google це не впливає.

Що таке Content-Signal у robots.txt#

Рядок, який додає керований robots.txt від Cloudflare, наприклад Content-Signal: search=yes, ai-train=no, use=reference. Він виражає побажання за сценарієм використання, а не за ботом. Дотримання добровільне, а IETF стандартизує споріднений словник (train-ai, search) у робочій групі AI Preferences. У моєму скані за серпень 2026 його публікували 5 із 53 сайтів.

Як часто оновлювати список AI-краулерів у robots.txt#

Перевіряйте щокварталу. Між 2024 і 2026 роками Anthropic вивела з ужитку anthropic-ai і Claude-Web та додала Claude-User і Claude-SearchBot; OpenAI додала OAI-SearchBot і OAI-AdsBot; Mistral додала три боти. Два з 53 просканованих сайтів досі тримають виведений токен anthropic-ai; обидва блокують і ClaudeBot, тож застарілий рядок лише додає шуму. А от файл, у якому стоїть сам anthropic-ai, не блокував би нічого з того, що Anthropic запускає сьогодні.

Джерела#

Частина кластера Answer Engine Optimization - повний порядок читання і глосарій усіх термінів, що трапляються в цих статтях.

Нові статті на пошту

Одна стаття раз на два тижні - про AI-пошук і код за ним. Підтвердження листом, відписка в один клік.