# Глосарій AEO та GEO

> Короткі означення термінів, які справді змінюють роботу: llms.txt, JSON-LD, ембединги, чанкінг, grounding, RAG, user-agent краулера.

**Canonical:** https://alexturik.com/uk/aeo/glossary

Терміни лишаються англійськими, бо саме так вони написані в документації вендорів і в коді. Пояснення - українською, по два-три речення на кожен.

*In English: [AEO & GEO glossary](/aeo/glossary).*

Терміни лишаються англійськими навмисно. Саме так вони написані в документації
вендорів, у логах і в коді, тож перекладений термін довелося б перекладати назад
щоразу, коли доходить до роботи. Українською тут - пояснення.

## Формати й файли

### llms.txt

Текстовий файл у корені домену (`/llms.txt`), який подає машині впорядкований
покажчик сайту: що це за сайт, які сторінки головні, де взяти їхні markdown
версії. Конвенція, не стандарт: жоден вендор не зобов'язувався його читати. Коштує
15 хвилин і не ламає нічого - тому й поширився. Як він робиться на Next.js -
[у статті](/blog/how-i-added-llms-txt-to-my-nextjs-blog-in-15-minutes).

### llms-full.txt

Те саме, але з повним текстом кожної сторінки в одному файлі. На цьому сайті
покажчик важить близько 12 КБ, повна версія - близько 240 КБ. Сенс у тому, щоб
модель, яка хоче прочитати сайт цілком, зробила один запит замість двох десятків.

### Markdown-двійник (`.md`-дзеркало)

Та сама сторінка, віддана як `text/markdown` за адресою на кшталт
`/blog/стаття.md`. Краулеру не доводиться зчищати HTML, навігацію і скрипти, щоб
дістатися тексту. За скануванням серпня 2026 таке має 8,6% сторінок у видачі за
AEO-запитами.

### AGENTS.md

Файл у корені репозиторію з інструкціями для кодових агентів - Claude Code,
Cursor, Aider. Не має стосунку до ШІ-пошуку: `llms.txt` описує сайт для читача,
`AGENTS.md` описує репозиторій для того, хто в ньому працюватиме.

## Розмітка

### JSON-LD

Структуровані дані у форматі JSON, вкладені в сторінку окремим тегом `script`.
Кажуть машині те, чого не видно з тексту: що це стаття, хто автор, коли
опубліковано і коли оновлено. Формат, який Google рекомендує, і єдиний, який тут
використовується. Розбір -
[у статті](/blog/help-ai-understand-your-content-with-json-ld).

### schema.org

Словник типів і полів, якими наповнюють JSON-LD: `Article`, `FAQPage`, `Person`,
`SoftwareApplication`, `BreadcrumbList`. JSON-LD - це синтаксис, schema.org - це
словник.

### FAQPage

Тип розмітки для списку питань і відповідей. Ключова умова: розмітка мусить
збігатися з текстом, який бачить людина. Розходження між ними - це те, що Google
називає misleading markup, і на цьому сайті `FAQPage` тому генерується з видимої
секції `## FAQ`, а не оголошується поруч із нею окремо.

### `datePublished` і `dateModified`

Два поля, які найбільше впливають на те, чи вважатиме ШІ-система вашу сторінку
актуальною. `dateModified`, який змінюється без змін у тексті, - це шум, а не
сигнал. Деталі - [тут](/blog/recency-and-authority-two-schema-fields-that-decide-ai-trust).

### `sameAs`

Поле в `Person` чи `Organization` зі списком профілів, які описують ту саму
сутність: GitHub, LinkedIn, X. Так система розуміє, що автор із трьох різних
сторінок - одна людина, а не троє тезок.

## Як працює пошук на моделях

### Embeddings (ембединги)

Перетворення тексту на вектор чисел так, щоб близькі за змістом тексти дали
близькі вектори. Це те, на чому стоїть увесь семантичний пошук: система порівнює
не слова, а напрямки. Подивитися вживу можна
[в пісочниці](/tools/embedding-playground).

### Cosine similarity

Міра схожості двох векторів - косинус кута між ними, від -1 до 1. Саме її
рахують, коли кажуть «ця сторінка ближча до запиту».

### Chunking (чанкінг)

Розбиття сторінки на фрагменти перед індексацією. Дістають і цитують не
сторінку, а чанк, тому розділ, зрозумілий лише в контексті попередніх трьох, з
високою ймовірністю не буде процитований узагалі. Звідси вимога до заголовків -
[розбір](/blog/semantic-html-for-machines-heading-hierarchy).

### Retrieval

Етап пошуку доречних фрагментів, який відбувається до генерації відповіді. Якщо
вас не дістали на цьому етапі, якість тексту вже не має значення.

### RAG (Retrieval-Augmented Generation)

Схема, за якою модель спершу шукає доречні фрагменти, а потім генерує відповідь,
спираючись на них. Так працюють ChatGPT Search, Perplexity і AI Overviews.
Протилежність - відповідь із самої лише пам'яті моделі, без пошуку.

### Grounding

Прив'язка згенерованої відповіді до конкретних джерел. Саме grounding перетворює
згадку на цитату з посиланням, тобто на те, заради чого робиться AEO.

## Краулери й доступ

### User-agent

Рядок, яким клієнт представляється серверу: `GPTBot`, `ClaudeBot`,
`PerplexityBot`. Це звичайний заголовок, який може надіслати будь-хто, тому
перевіряти бота треба за IP з офіційного списку вендора, а не за іменем. Повна
таблиця з 44 токенами -
[тут](/blog/ai-crawler-list-robots-txt-2026).

### robots.txt

Файл у корені домену, який каже краулерам, куди можна. Працює за іменем бота,
кожен вендор документує свої окремо. Важливо: боти, які відкривають сторінку на
прохання людини (`ChatGPT-User`, `Perplexity-User`), за власною документацією
вендорів `robots.txt` можуть не виконувати.

### `noindex`

Директива в мета-тезі `robots` або в заголовку `X-Robots-Tag`, яка забороняє
індексувати сторінку. Поширений міф, ніби вона означає «не тренуйтеся на цьому»,
- жоден із великих вендорів такого не документує. Але наслідок реальний: без
індексації вас не дістануть, а отже не процитують.
[Розбір](/blog/the-3-word-tag-that-hides-your-best-pages-from-ai).

### Content-Signal

Рядок у `robots.txt`, який Cloudflare додає у свою керовану версію файлу:
`Content-Signal: search=yes, ai-train=no`. Виражає побажання за призначенням, а
не за ботом. Виконання добровільне; IETF стандартизує споріднений словник.

## Дисципліни

### AEO / GEO / LLMO

Три назви приблизно однієї роботи: зробити сторінку придатною для цитування
мовною моделлю. Різниця - в акценті, не в техніці. Порівняння -
[у статті](/blog/geo-vs-seo-vs-aeo).

### E-E-A-T

Experience, Expertise, Authoritativeness, Trustworthiness. Критерії Google для
оцінки якості, які в ШІ-пошуку працюють так само: система охочіше цитує джерело,
у якого видно автора, дату і причину йому довіряти.

## FAQ

### Чому терміни не перекладені українською

Бо в документації вендорів, у коді і в логах вони написані англійською, і
перекладений термін довелося б перекладати назад щоразу, коли справа доходить до
роботи. Тут перекладені пояснення, а не назви.

### Чим llms.txt відрізняється від AGENTS.md

Різні читачі. `llms.txt` описує сайт для моделі, яка шукає відповідь на запит
користувача. `AGENTS.md` описує репозиторій для кодового агента, який
збирається в ньому працювати. Спільного між ними лише те, що обидва - текстові
файли за домовленістю, а не за стандартом.

### Що таке чанк і чому він важливіший за сторінку

Чанк - це фрагмент, на які сторінка ділиться перед індексацією. ШІ-система
дістає і цитує саме фрагмент, а не документ цілком. Тому розділ, який зрозумілий
лише після трьох попередніх, має менше шансів бути процитованим, ніж розділ,
який тримається сам.

### Чи достатньо додати JSON-LD, щоб мене цитували

Ні. JSON-LD закриває третю з чотирьох умов - щоб машина розібрала структуру.
Якщо краулер не дістає сторінку або отримує порожню оболонку без JavaScript,
розмітка не рятує нічого. Порядок умов є [на головній сторінці кластера](/uk/aeo).
