Три слова в head, які ховають ваші сторінки від AI
· 9 хв читання · Оновлено
In English: The 3-Word Tag That Hides Your Best Pages from AI — read in English
Три слова. Три значення. І ваша найкраща стаття зникає з ChatGPT, Claude і Perplexity, навіть якщо Google її ще показує.
Мова про <meta name="robots">. Тег у <head>, на який ви, може, ніколи й не дивилися. Тег, який ваша CMS додала, не спитавши. Той самий, що просто зараз тихо вбиває ваше AEO.
Що таке robots-метатег#
<meta name="robots" content="..."> - це директива для краулерів. Вона каже машині, що робити з цією сторінкою, чого не робити, і чи варто ходити за посиланнями з неї.
Значення йдуть парами або поодинці:
index/noindex- індексувати чи ні.follow/nofollow- ходити за внутрішніми й зовнішніми посиланнями чи ні.none- скорочення дляnoindex, nofollow.noarchive- не тримати кешованої копії.nosnippet- не показувати фрагмент тексту у видачі.
Типова поведінка без тега - index, follow. Саме цього ви й хочете на 99% публічних сторінок.
Як AI-агенти читають robots-тег#
GPTBot. ClaudeBot. PerplexityBot. Усі три публікують токени user-agent і кажуть, що поважають robots.txt. Чого не публікує жоден - правила для метатега robots. Документація краулерів OpenAI описує robots.txt і взагалі не згадує noindex, і я не знайшов заяви OpenAI, Anthropic чи Perplexity про те, що noindex у <head> тримає сторінку поза тренувальним набором. Версія цього твердження, яку повторюють усюди - «noindex означає не тренуйся на мені», - не має за собою жодного вендора. Ставтеся до неї як до фольклору.
Два вендори є винятком, і це не ті двоє, на кого ви подумали: Apple документує, що Applebot поважає noindex і nosnippet, Amazon документує те саме для Amazonbot. Обидва є в списку AI-краулерів на 2026 рік, де по кожному боту розписано, що саме вендор зобовʼязується робити.
Вужче твердження вціліло, і саме воно коштує вам трафіку. noindex - це директива для пошукового індексу, а асистент, якому треба дістати вашу сторінку, перш ніж її процитувати, шукає її через пошуковий індекс. Закрийте індекс - і втратите цитату. Не тому, що хтось шанував відмову від тренування, а тому, що вас просто ніщо не знайшло.
nofollow, схоже, трактують вільніше, ближче до підказки про якість, ніж до жорсткої заборони. Це вже моє прочитання спостережуваної поведінки, а не задокументоване правило.
Висновок не змінюється й лишається жорстким: випадковий noindex на вашій найкращій статті - це бетонна стіна перед тим AI-трафіком, який вам потрібен.
Чим це відрізняється від robots.txt#
robots.txt- глобальна гумка. Він накриває весь сайт або цілі директорії за шаблоном.<meta name="robots">- тонкий інструмент. Працює строго на рівні окремого HTML-документа.
Саме тут ховається найнебезпечніша пастка: сайт може бути ідеально індексованим, robots.txt чистим і правильним, сайтмап - з потрібними URL, а одна конкретна стаття все одно закрита тегом, який дожив із застарілого шаблону або дефолту CMS. Найжорсткіший варіант: це може бути ваша найконверсійніша стаття, і ви нічого не помічаєте, доки трафік із AI-джерел не почне сохнути.
Як noindex потрапляє в продакшн випадково#
-
Стейдж поїхав у продакшн без прибирання. Інженер поставив
noindexна стейджовому домені, щоб не дублювати індексацію й не зливати прев'ю в Google. Деплой пройшов - і тег поїхав у прод, бо ніхто не додав у пайплайн крок «зняти robots-мету на продакшн-білді». -
Шаблон CMS успадкував
noindexз режиму прев'ю. Hugo, Next.js, WordPress, Webflow - фреймворк не має значення. Якщо в шаблоні є<meta name="robots" content="noindex">під умовою на кшталтif env === 'preview', а умова зламалась або змінна оточення не доїхала на білді, ви везетеnoindexу прод. Тихо. Жодної помилки в консолі компілятора. -
Сторінка «скоро запуск» не оновилась після релізу. Лендинг опублікували з
noindexза тиждень до старту, щоб ніщо не проіндексувало порожній кістяк. Старт відбувся. Тег ніхто не зняв. Через кілька місяців ви дивуєтесь, чому сторінка продукту не зʼявляється у відповідях ChatGPT.
Усі три трапляються значно частіше, ніж здається. Усі три проходять код-рев'ю, бо візуально цей тег зливається з рештою «стандартного HTML-обвісу».
Як перевірити це за 30 секунд#
Найшвидший шлях: відкрити сторінку → View Page Source (Ctrl+U) → Ctrl+F по слову robots. Побачили noindex - маєте проблему.
Більш інженерна перевірка - один сніпет у консолі DevTools, який можна запустити на будь-якій сторінці:
const robotsMeta = document.querySelector('meta[name="robots"]');
if (robotsMeta) {
console.warn(`Found robots meta with content "${robotsMeta.content}"`);
if (robotsMeta.content.includes('noindex')) {
console.error('CRITICAL: This page is hidden from AI crawlers.');
}
} else {
console.log('No robots meta. Default behavior: index, follow. ✓');
}Для масового аудиту по всьому сайту беріть Screaming Frog, Sitebulb або напишіть невеликий скрипт на Playwright чи Puppeteer, який пройде ваш сайтмап і вивалить усі <meta>-теги за один прохід.
Як полагодити це в Next.js#
Просто видаліть тег. Типова поведінка - index, follow. Саме її ви й хочете.
Не додавайте <meta name="robots" content="index, follow"> явно. Це візуальний шум. Краулер робить так за замовчуванням - ви лише рендерите зайві байти без причини.
Ось правильна форма в Next.js (App Router):
import type { Metadata } from 'next';
export const metadata: Metadata = {
title: 'How meta robots actually works',
description: 'A full breakdown of meta robots and AI crawling.',
// DO NOT WRITE robots: { index: true, follow: true }
// Next.js does not emit this tag by default — that is the desired behavior.
// Use the robots object only for explicit denial:
// robots: { index: false, follow: false }
};
export default function BlogPostPage() {
return (
<article className="max-w-3xl mx-auto py-10 px-4">
<h1 className="text-4xl font-bold">How meta robots actually works</h1>
<p className="mt-4">Article body…</p>
</article>
);
}Чистий аудит вважає відсутність тега проходженням. Явний index, follow теж проходить, але технічно зайвий.
Коли noindex справді доречний#
noindex має сенс на:
- сторінках
archiveіtag, що плодять дубльований контент; - сторінках пагінації на кшталт
/blog/page/2/, особливо колиrel="canonical"вказує на першу; - тонких сторінках: результати локального пошуку, відфільтровані переліки, URL із параметрами сортування;
- внутрішніх сторінках (
/admin,/healthz,/test).
На канонічних статтях блогу, продуктових лендингах, головній - ніколи. Якщо ваша стратегія зводиться до «хочу, щоб мене цитували Claude і ChatGPT», кожен noindex на контентній сторінці - добровільна віддача трафіку. Протилежний хід, тобто явне запрошення для AI-краулерів, займає близько пʼятнадцяти хвилин через llms.txt.
А що з заголовком X-Robots-Tag#
Точно того самого ефекту можна досягти на рівні сервера, через HTTP-заголовок відповіді:
HTTP/2 200 OK
Content-Type: text/html; charset=utf-8
X-Robots-Tag: noindexПрацює так само, як метатег, але помітити його значно важче - його взагалі немає в HTML. View Source не показує нічого. Треба дивитися вкладку Network у DevTools або перевіряти відповідь сервера з термінала:
curl -I https://example.com/page/Якщо HTML чистий, аудит зелений, а сторінка все одно не зʼявляється у відповідях AI, дивіться заголовки відповіді. Серверний X-Robots-Tag - категорія багів, яку майже неможливо вловити з боку фронтенду.
Довідник директив#
Те саме слово робить різну роботу залежно від того, хто його читає.
Колонка Google - задокументована поведінка з власного довідника Google по robots-мета. Колонка AI-краулерів - ні. Жоден вендор не публікує, як його асистент обробляє метатег robots, тож кожна клітинка там - спостереження або припущення: що я бачу, а не що хтось пообіцяв. Будуйте на колонці Google, а другу тримайте як робочу модель, яка може виявитись хибною.
| Директива | Google (задокументовано) | AI-краулери (спостереження, без документації) | Де може ховатись |
|---|---|---|---|
noindex |
Прибирає URL з індексу | Сторінка перестає бути дістаною, отже перестає цитуватись | <head>, X-Robots-Tag |
nofollow |
Не ходить за посиланнями зі сторінки | Схоже, працює як слабка підказка про якість | <head>, X-Robots-Tag |
none |
noindex, nofollow |
Обидва пункти вище | Будь-де |
noarchive |
Немає кешованої копії | Схоже, ігнорується | Будь-де |
nosnippet |
Немає текстового фрагмента у видачі | Схоже, глушить пряме цитування | Будь-де |
| відсутній | index, follow |
Вільно читати й цитувати | - |
Останній рядок - той, до якого варто прагнути. Явний <meta name="robots" content="index, follow"> не є сильнішим «так», ніж мовчання; це мертва вага, яку частина аудитів позначає як надлишкову директиву.
FAQ#
noindex блокує AI-краулерів чи лише пошуковики#
Він напряму блокує пошуковий індекс, а цитування в AI - як наслідок. Apple і Amazon - єдині два вендори, які документують, що їхні краулери поважають noindex (Applebot і Amazonbot). OpenAI, Anthropic і Perplexity документують robots.txt і мовчать про метатег robots, тож «noindex означає не тренуйся на мені» - фольклор, а не зобовʼязання вендора. Що справді коштує вам цитати - твердження вужче й певніше: асистент мусить дістати сторінку, перш ніж її процитувати, а дістає він через пошуковий індекс. Закриєте індекс - вас ніщо не знайде.
Чим noindex відрізняється від Disallow у robots.txt#
Disallow спиняє завантаження; noindex спиняє використання. Це не взаємозамінні речі, і поєднувати їх шкідливо: краулер, заблокований у robots.txt, ніколи не завантажить сторінку, а отже ніколи не побачить noindex, який ви там поставили. Хочете виключити сторінку - дайте її просканувати й дозвольте тегу зробити роботу.
Чому CMS додає noindex, не спитавши#
Бо протікають дефолти стейджу. Три типові маршрути: стейдж-середовище поїхало в продакшн з увімкненим прапорцем «не пускати пошуковики», SEO-плагін застосував правило до цілого типу записів, і дефолт фреймворку в спільному лейауті, який успадкував новий маршрут. Усі три невидимі в редакторі.
Чи можна поставити noindex так, щоб його не було в HTML#
Так - через заголовок відповіді X-Robots-Tag, і саме цю версію справді важко знайти. View Source не показує нічого, CMS не показує нічого, видають лише заголовки відповіді. Перевіряйте через curl -I, перш ніж вирішити, що HTML чистий.
Як швидко перевірити сторінку#
curl -sI https://example.com/page | grep -i x-robots-tag для заголовка і пошук по name="robots" у відданому HTML для тега. Розширення AEO Checker перевіряє обидва одразу на тій вкладці, яку ви дивитесь.
Джерела#
- Google Search Central: robots meta tag and X-Robots-Tag - повний список директив і синтаксис заголовка
- RFC 9309: Robots Exclusion Protocol - стандартизована семантика robots.txt і чому це контроль на етапі завантаження
- OpenAI: bots and crawlers - GPTBot, OAI-SearchBot і ChatGPT-User, і що поважає кожен
- Anthropic: does Anthropic crawl the web? - задокументована поведінка ClaudeBot
Частина кластера Answer Engine Optimization - повний порядок читання і глосарій усіх термінів, що трапляються в цих статтях.
Коротко
Три слова в <head> можуть коштувати вам усього AI-трафіку. Один невидимий заголовок робить те саме, не лишаючи сліду в HTML.
Аудит займає 30 секунд. Виправлення - одна кома і два рядки коду. Ризик - ваш найцінніший контент, тихо невидимий для цілого покоління AI-пошуку, яке формується просто зараз.
Підписуйтесь у LinkedIn, якщо цікавить AEO й архітектура AI-пошуку. Потрібен аудит готовності сайту до AI - напишіть.