← Oleksii Turovskyi

Глосарій AEO та GEO

Терміни лишаються англійськими, бо саме так вони написані в документації вендорів і в коді. Пояснення - українською, по два-три речення на кожен.

In English: AEO & GEO glossary.

Терміни лишаються англійськими навмисно. Саме так вони написані в документації вендорів, у логах і в коді, тож перекладений термін довелося б перекладати назад щоразу, коли доходить до роботи. Українською тут - пояснення.

Формати й файли#

llms.txt#

Текстовий файл у корені домену (/llms.txt), який подає машині впорядкований покажчик сайту: що це за сайт, які сторінки головні, де взяти їхні markdown версії. Конвенція, не стандарт: жоден вендор не зобов'язувався його читати. Коштує 15 хвилин і не ламає нічого - тому й поширився. Як він робиться на Next.js - у статті.

llms-full.txt#

Те саме, але з повним текстом кожної сторінки в одному файлі. На цьому сайті покажчик важить близько 12 КБ, повна версія - близько 240 КБ. Сенс у тому, щоб модель, яка хоче прочитати сайт цілком, зробила один запит замість двох десятків.

Markdown-двійник (.md-дзеркало)#

Та сама сторінка, віддана як text/markdown за адресою на кшталт /blog/стаття.md. Краулеру не доводиться зчищати HTML, навігацію і скрипти, щоб дістатися тексту. За скануванням серпня 2026 таке має 8,6% сторінок у видачі за AEO-запитами.

AGENTS.md#

Файл у корені репозиторію з інструкціями для кодових агентів - Claude Code, Cursor, Aider. Не має стосунку до ШІ-пошуку: llms.txt описує сайт для читача, AGENTS.md описує репозиторій для того, хто в ньому працюватиме.

Розмітка#

JSON-LD#

Структуровані дані у форматі JSON, вкладені в сторінку окремим тегом script. Кажуть машині те, чого не видно з тексту: що це стаття, хто автор, коли опубліковано і коли оновлено. Формат, який Google рекомендує, і єдиний, який тут використовується. Розбір - у статті.

schema.org#

Словник типів і полів, якими наповнюють JSON-LD: Article, FAQPage, Person, SoftwareApplication, BreadcrumbList. JSON-LD - це синтаксис, schema.org - це словник.

FAQPage#

Тип розмітки для списку питань і відповідей. Ключова умова: розмітка мусить збігатися з текстом, який бачить людина. Розходження між ними - це те, що Google називає misleading markup, і на цьому сайті FAQPage тому генерується з видимої секції ## FAQ, а не оголошується поруч із нею окремо.

datePublished і dateModified#

Два поля, які найбільше впливають на те, чи вважатиме ШІ-система вашу сторінку актуальною. dateModified, який змінюється без змін у тексті, - це шум, а не сигнал. Деталі - тут.

sameAs#

Поле в Person чи Organization зі списком профілів, які описують ту саму сутність: GitHub, LinkedIn, X. Так система розуміє, що автор із трьох різних сторінок - одна людина, а не троє тезок.

Як працює пошук на моделях#

Embeddings (ембединги)#

Перетворення тексту на вектор чисел так, щоб близькі за змістом тексти дали близькі вектори. Це те, на чому стоїть увесь семантичний пошук: система порівнює не слова, а напрямки. Подивитися вживу можна в пісочниці.

Cosine similarity#

Міра схожості двох векторів - косинус кута між ними, від -1 до 1. Саме її рахують, коли кажуть «ця сторінка ближча до запиту».

Chunking (чанкінг)#

Розбиття сторінки на фрагменти перед індексацією. Дістають і цитують не сторінку, а чанк, тому розділ, зрозумілий лише в контексті попередніх трьох, з високою ймовірністю не буде процитований узагалі. Звідси вимога до заголовків - розбір.

Retrieval#

Етап пошуку доречних фрагментів, який відбувається до генерації відповіді. Якщо вас не дістали на цьому етапі, якість тексту вже не має значення.

RAG (Retrieval-Augmented Generation)#

Схема, за якою модель спершу шукає доречні фрагменти, а потім генерує відповідь, спираючись на них. Так працюють ChatGPT Search, Perplexity і AI Overviews. Протилежність - відповідь із самої лише пам'яті моделі, без пошуку.

Grounding#

Прив'язка згенерованої відповіді до конкретних джерел. Саме grounding перетворює згадку на цитату з посиланням, тобто на те, заради чого робиться AEO.

Краулери й доступ#

User-agent#

Рядок, яким клієнт представляється серверу: GPTBot, ClaudeBot, PerplexityBot. Це звичайний заголовок, який може надіслати будь-хто, тому перевіряти бота треба за IP з офіційного списку вендора, а не за іменем. Повна таблиця з 44 токенами - тут.

robots.txt#

Файл у корені домену, який каже краулерам, куди можна. Працює за іменем бота, кожен вендор документує свої окремо. Важливо: боти, які відкривають сторінку на прохання людини (ChatGPT-User, Perplexity-User), за власною документацією вендорів robots.txt можуть не виконувати.

noindex#

Директива в мета-тезі robots або в заголовку X-Robots-Tag, яка забороняє індексувати сторінку. Поширений міф, ніби вона означає «не тренуйтеся на цьому»,

  • жоден із великих вендорів такого не документує. Але наслідок реальний: без індексації вас не дістануть, а отже не процитують. Розбір.

Content-Signal#

Рядок у robots.txt, який Cloudflare додає у свою керовану версію файлу: Content-Signal: search=yes, ai-train=no. Виражає побажання за призначенням, а не за ботом. Виконання добровільне; IETF стандартизує споріднений словник.

Дисципліни#

AEO / GEO / LLMO#

Три назви приблизно однієї роботи: зробити сторінку придатною для цитування мовною моделлю. Різниця - в акценті, не в техніці. Порівняння - у статті.

E-E-A-T#

Experience, Expertise, Authoritativeness, Trustworthiness. Критерії Google для оцінки якості, які в ШІ-пошуку працюють так само: система охочіше цитує джерело, у якого видно автора, дату і причину йому довіряти.

FAQ#

Чому терміни не перекладені українською#

Бо в документації вендорів, у коді і в логах вони написані англійською, і перекладений термін довелося б перекладати назад щоразу, коли справа доходить до роботи. Тут перекладені пояснення, а не назви.

Чим llms.txt відрізняється від AGENTS.md#

Різні читачі. llms.txt описує сайт для моделі, яка шукає відповідь на запит користувача. AGENTS.md описує репозиторій для кодового агента, який збирається в ньому працювати. Спільного між ними лише те, що обидва - текстові файли за домовленістю, а не за стандартом.

Що таке чанк і чому він важливіший за сторінку#

Чанк - це фрагмент, на які сторінка ділиться перед індексацією. ШІ-система дістає і цитує саме фрагмент, а не документ цілком. Тому розділ, який зрозумілий лише після трьох попередніх, має менше шансів бути процитованим, ніж розділ, який тримається сам.

Чи достатньо додати JSON-LD, щоб мене цитували#

Ні. JSON-LD закриває третю з чотирьох умов - щоб машина розібрала структуру. Якщо краулер не дістає сторінку або отримує порожню оболонку без JavaScript, розмітка не рятує нічого. Порядок умов є на головній сторінці кластера.