← Oleksii Turovskyi

Три слова в head, які ховають ваші сторінки від AI

· 9 хв читання · Оновлено

In English: The 3-Word Tag That Hides Your Best Pages from AIread in English

Три слова. Три значення. І ваша найкраща стаття зникає з ChatGPT, Claude і Perplexity, навіть якщо Google її ще показує.

Мова про <meta name="robots">. Тег у <head>, на який ви, може, ніколи й не дивилися. Тег, який ваша CMS додала, не спитавши. Той самий, що просто зараз тихо вбиває ваше AEO.

Що таке robots-метатег#

<meta name="robots" content="..."> - це директива для краулерів. Вона каже машині, що робити з цією сторінкою, чого не робити, і чи варто ходити за посиланнями з неї.

Значення йдуть парами або поодинці:

  • index / noindex - індексувати чи ні.
  • follow / nofollow - ходити за внутрішніми й зовнішніми посиланнями чи ні.
  • none - скорочення для noindex, nofollow.
  • noarchive - не тримати кешованої копії.
  • nosnippet - не показувати фрагмент тексту у видачі.

Типова поведінка без тега - index, follow. Саме цього ви й хочете на 99% публічних сторінок.

Як AI-агенти читають robots-тег#

GPTBot. ClaudeBot. PerplexityBot. Усі три публікують токени user-agent і кажуть, що поважають robots.txt. Чого не публікує жоден - правила для метатега robots. Документація краулерів OpenAI описує robots.txt і взагалі не згадує noindex, і я не знайшов заяви OpenAI, Anthropic чи Perplexity про те, що noindex у <head> тримає сторінку поза тренувальним набором. Версія цього твердження, яку повторюють усюди - «noindex означає не тренуйся на мені», - не має за собою жодного вендора. Ставтеся до неї як до фольклору.

Два вендори є винятком, і це не ті двоє, на кого ви подумали: Apple документує, що Applebot поважає noindex і nosnippet, Amazon документує те саме для Amazonbot. Обидва є в списку AI-краулерів на 2026 рік, де по кожному боту розписано, що саме вендор зобовʼязується робити.

Вужче твердження вціліло, і саме воно коштує вам трафіку. noindex - це директива для пошукового індексу, а асистент, якому треба дістати вашу сторінку, перш ніж її процитувати, шукає її через пошуковий індекс. Закрийте індекс - і втратите цитату. Не тому, що хтось шанував відмову від тренування, а тому, що вас просто ніщо не знайшло.

nofollow, схоже, трактують вільніше, ближче до підказки про якість, ніж до жорсткої заборони. Це вже моє прочитання спостережуваної поведінки, а не задокументоване правило.

Висновок не змінюється й лишається жорстким: випадковий noindex на вашій найкращій статті - це бетонна стіна перед тим AI-трафіком, який вам потрібен.

Чим це відрізняється від robots.txt#

  • robots.txt - глобальна гумка. Він накриває весь сайт або цілі директорії за шаблоном.
  • <meta name="robots"> - тонкий інструмент. Працює строго на рівні окремого HTML-документа.

Саме тут ховається найнебезпечніша пастка: сайт може бути ідеально індексованим, robots.txt чистим і правильним, сайтмап - з потрібними URL, а одна конкретна стаття все одно закрита тегом, який дожив із застарілого шаблону або дефолту CMS. Найжорсткіший варіант: це може бути ваша найконверсійніша стаття, і ви нічого не помічаєте, доки трафік із AI-джерел не почне сохнути.

Як noindex потрапляє в продакшн випадково#

  1. Стейдж поїхав у продакшн без прибирання. Інженер поставив noindex на стейджовому домені, щоб не дублювати індексацію й не зливати прев'ю в Google. Деплой пройшов - і тег поїхав у прод, бо ніхто не додав у пайплайн крок «зняти robots-мету на продакшн-білді».

  2. Шаблон CMS успадкував noindex з режиму прев'ю. Hugo, Next.js, WordPress, Webflow - фреймворк не має значення. Якщо в шаблоні є <meta name="robots" content="noindex"> під умовою на кшталт if env === 'preview', а умова зламалась або змінна оточення не доїхала на білді, ви везете noindex у прод. Тихо. Жодної помилки в консолі компілятора.

  3. Сторінка «скоро запуск» не оновилась після релізу. Лендинг опублікували з noindex за тиждень до старту, щоб ніщо не проіндексувало порожній кістяк. Старт відбувся. Тег ніхто не зняв. Через кілька місяців ви дивуєтесь, чому сторінка продукту не зʼявляється у відповідях ChatGPT.

Усі три трапляються значно частіше, ніж здається. Усі три проходять код-рев'ю, бо візуально цей тег зливається з рештою «стандартного HTML-обвісу».

Як перевірити це за 30 секунд#

Найшвидший шлях: відкрити сторінку → View Page Source (Ctrl+U) → Ctrl+F по слову robots. Побачили noindex - маєте проблему.

Більш інженерна перевірка - один сніпет у консолі DevTools, який можна запустити на будь-якій сторінці:

devtools-meta-robots-check.js
const robotsMeta = document.querySelector('meta[name="robots"]');
 
if (robotsMeta) {
  console.warn(`Found robots meta with content "${robotsMeta.content}"`);
  if (robotsMeta.content.includes('noindex')) {
    console.error('CRITICAL: This page is hidden from AI crawlers.');
  }
} else {
  console.log('No robots meta. Default behavior: index, follow. ✓');
}

Для масового аудиту по всьому сайту беріть Screaming Frog, Sitebulb або напишіть невеликий скрипт на Playwright чи Puppeteer, який пройде ваш сайтмап і вивалить усі <meta>-теги за один прохід.

Як полагодити це в Next.js#

Просто видаліть тег. Типова поведінка - index, follow. Саме її ви й хочете.

Не додавайте <meta name="robots" content="index, follow"> явно. Це візуальний шум. Краулер робить так за замовчуванням - ви лише рендерите зайві байти без причини.

Ось правильна форма в Next.js (App Router):

app/blog/[slug]/page.tsx
import type { Metadata } from 'next';
 
export const metadata: Metadata = {
  title: 'How meta robots actually works',
  description: 'A full breakdown of meta robots and AI crawling.',
  // DO NOT WRITE robots: { index: true, follow: true }
  // Next.js does not emit this tag by default — that is the desired behavior.
  // Use the robots object only for explicit denial:
  // robots: { index: false, follow: false }
};
 
export default function BlogPostPage() {
  return (
    <article className="max-w-3xl mx-auto py-10 px-4">
      <h1 className="text-4xl font-bold">How meta robots actually works</h1>
      <p className="mt-4">Article body…</p>
    </article>
  );
}

Чистий аудит вважає відсутність тега проходженням. Явний index, follow теж проходить, але технічно зайвий.

Коли noindex справді доречний#

noindex має сенс на:

  • сторінках archive і tag, що плодять дубльований контент;
  • сторінках пагінації на кшталт /blog/page/2/, особливо коли rel="canonical" вказує на першу;
  • тонких сторінках: результати локального пошуку, відфільтровані переліки, URL із параметрами сортування;
  • внутрішніх сторінках (/admin, /healthz, /test).

На канонічних статтях блогу, продуктових лендингах, головній - ніколи. Якщо ваша стратегія зводиться до «хочу, щоб мене цитували Claude і ChatGPT», кожен noindex на контентній сторінці - добровільна віддача трафіку. Протилежний хід, тобто явне запрошення для AI-краулерів, займає близько пʼятнадцяти хвилин через llms.txt.

А що з заголовком X-Robots-Tag#

Точно того самого ефекту можна досягти на рівні сервера, через HTTP-заголовок відповіді:

HTTP/2 200 OK
Content-Type: text/html; charset=utf-8
X-Robots-Tag: noindex

Працює так само, як метатег, але помітити його значно важче - його взагалі немає в HTML. View Source не показує нічого. Треба дивитися вкладку Network у DevTools або перевіряти відповідь сервера з термінала:

curl -I https://example.com/page/

Якщо HTML чистий, аудит зелений, а сторінка все одно не зʼявляється у відповідях AI, дивіться заголовки відповіді. Серверний X-Robots-Tag - категорія багів, яку майже неможливо вловити з боку фронтенду.

Довідник директив#

Те саме слово робить різну роботу залежно від того, хто його читає.

Колонка Google - задокументована поведінка з власного довідника Google по robots-мета. Колонка AI-краулерів - ні. Жоден вендор не публікує, як його асистент обробляє метатег robots, тож кожна клітинка там - спостереження або припущення: що я бачу, а не що хтось пообіцяв. Будуйте на колонці Google, а другу тримайте як робочу модель, яка може виявитись хибною.

Директива Google (задокументовано) AI-краулери (спостереження, без документації) Де може ховатись
noindex Прибирає URL з індексу Сторінка перестає бути дістаною, отже перестає цитуватись <head>, X-Robots-Tag
nofollow Не ходить за посиланнями зі сторінки Схоже, працює як слабка підказка про якість <head>, X-Robots-Tag
none noindex, nofollow Обидва пункти вище Будь-де
noarchive Немає кешованої копії Схоже, ігнорується Будь-де
nosnippet Немає текстового фрагмента у видачі Схоже, глушить пряме цитування Будь-де
відсутній index, follow Вільно читати й цитувати -

Останній рядок - той, до якого варто прагнути. Явний <meta name="robots" content="index, follow"> не є сильнішим «так», ніж мовчання; це мертва вага, яку частина аудитів позначає як надлишкову директиву.

FAQ#

noindex блокує AI-краулерів чи лише пошуковики#

Він напряму блокує пошуковий індекс, а цитування в AI - як наслідок. Apple і Amazon - єдині два вендори, які документують, що їхні краулери поважають noindex (Applebot і Amazonbot). OpenAI, Anthropic і Perplexity документують robots.txt і мовчать про метатег robots, тож «noindex означає не тренуйся на мені» - фольклор, а не зобовʼязання вендора. Що справді коштує вам цитати - твердження вужче й певніше: асистент мусить дістати сторінку, перш ніж її процитувати, а дістає він через пошуковий індекс. Закриєте індекс - вас ніщо не знайде.

Чим noindex відрізняється від Disallow у robots.txt#

Disallow спиняє завантаження; noindex спиняє використання. Це не взаємозамінні речі, і поєднувати їх шкідливо: краулер, заблокований у robots.txt, ніколи не завантажить сторінку, а отже ніколи не побачить noindex, який ви там поставили. Хочете виключити сторінку - дайте її просканувати й дозвольте тегу зробити роботу.

Чому CMS додає noindex, не спитавши#

Бо протікають дефолти стейджу. Три типові маршрути: стейдж-середовище поїхало в продакшн з увімкненим прапорцем «не пускати пошуковики», SEO-плагін застосував правило до цілого типу записів, і дефолт фреймворку в спільному лейауті, який успадкував новий маршрут. Усі три невидимі в редакторі.

Чи можна поставити noindex так, щоб його не було в HTML#

Так - через заголовок відповіді X-Robots-Tag, і саме цю версію справді важко знайти. View Source не показує нічого, CMS не показує нічого, видають лише заголовки відповіді. Перевіряйте через curl -I, перш ніж вирішити, що HTML чистий.

Як швидко перевірити сторінку#

curl -sI https://example.com/page | grep -i x-robots-tag для заголовка і пошук по name="robots" у відданому HTML для тега. Розширення AEO Checker перевіряє обидва одразу на тій вкладці, яку ви дивитесь.

Джерела#

Частина кластера Answer Engine Optimization - повний порядок читання і глосарій усіх термінів, що трапляються в цих статтях.


Коротко

Три слова в <head> можуть коштувати вам усього AI-трафіку. Один невидимий заголовок робить те саме, не лишаючи сліду в HTML.

Аудит займає 30 секунд. Виправлення - одна кома і два рядки коду. Ризик - ваш найцінніший контент, тихо невидимий для цілого покоління AI-пошуку, яке формується просто зараз.

Підписуйтесь у LinkedIn, якщо цікавить AEO й архітектура AI-пошуку. Потрібен аудит готовності сайту до AI - напишіть.

Нові статті на пошту

Одна стаття раз на два тижні - про AI-пошук і код за ним. Підтвердження листом, відписка в один клік.