Чанкинг (от англ. chunking — разбиение на части, сегментирование) в контексте поисковой оптимизации и систем искусственного интеллекта — это практика структурирования контента таким образом, чтобы отдельные его фрагменты (чанки, пассажи) могли быть эффективно извлечены системами Retrieval-Augmented Generation (RAG) и другими агентными системами. В более узком техническом смысле чанкинг — это действие, которое RAG-системы выполняют с контентом при его захвате для подготовки к процессу поиска: разбиение контента на серию компонентов, которые могут быть извлечены индивидуально на основе их релевантности запросу пользователя.
В современном информационном пространстве термин «чанкинг» используется для обозначения двух взаимосвязанных, но различных процессов:
Системный чанкинг — операция, выполняемая RAG-системами при индексации контента, когда документ разбивается на фрагменты (чанки) для последующего векторного поиска. Существуют различные стратегии чанкинга, включая семантическую, структурно-зависимую (layout-aware) и сегментацию по фиксированному числу токенов.
Оптимизационный чанкинг — сознательное структурирование контента автором или оптимизатором таким образом, чтобы пассажи легче извлекались в RAG-пайплайне. В этом смысле чанкинг пересекается с задачами контент-дизайна и UX-писательства, но отличается тем, что требует учёта вычислений релевантности на уровне отдельных пассажей.
Технические основы
Векторное пространство и релевантность
Поисковые системы и большие языковые модели построены на векторно-пространственной модели: релевантность является функцией мер расстояния между запросами/промптами и документами. Чанкинг влияет на эти расстояния: более длинный текст, охватывающий несколько тем, как правило, имеет меньшую релевантность по сравнению с более коротким текстом, посвящённым одной теме.
Экспериментальные данные показывают, что разбиение параграфа на две части улучшает показатели косинусного подобия для соответствующих запросов. В одном из тестов релевантность для запроса «машинное обучение» выросла на 19,24 % после разделения смешанного параграфа. Добавление заголовков также значительно улучшает показатели — например, косинусное подобие для параграфа о защите данных выросло ещё на 17,54 %.
Алгоритмы и архитектуры
Google использует многоаспектную технику встраивания MUVERA (Multi-Vector Retrieval As Fast As Single-Vector Search). В качестве меры расстояния применяется Chamfer Similarity.
Современные исследования в области обработки длинных контекстов показывают, что структура контента становится важнее, а не менее важной по мере развития технологий:
Ring Attention (Berkeley) — демонстрирует, как сверхдлинные последовательности могут обрабатываться путём разбиения на вращающиеся сегменты, где каждый сегмент обрабатывается локально, передавая обобщённое состояние дальше.
Infini-attention (Google) — вводит компрессионную память, позволяющую моделям сохранять и повторно использовать информацию далеко за пределами фиксированного контекстного окна.
MemWalker (Meta) — организует контент в деревья памяти, которые могут быть просмотрены, пересмотрены и обновлены.
Рекурсивные языковые модели (MIT) — разлагают длинные входные данные на меньшие блоки и рекурсивно вызывают модель для наиболее релевантных чанков.
В этих системах пассажи остаются атомарной единицей смысла, а модели оперируют на уровне чанков, а не страниц.
Отличие от классической SEO-оптимизации
В классической поисковой оптимизации границы контента определялись интуицией и редакционными соглашениями, а анализ был лексическим и постраничным. Чанкинг как оптимизационная тактика меняет этот подход: каждое сегментированное высказывание может рассматриваться как дискретный объект релевантности.
Ключевые отличия:
Характеристика
Классическое SEO
Чанкинг
Единица анализа
Страница целиком
Отдельные пассажи
Метод оценки
Лексический, агрегированный
Векторный, на уровне пассажей
Обратная связь
Ранжирование страницы
Изолированная улучшаемость блоков
Подход
Комплексный
Атомарный
Чанкинг предлагает прямой цикл обратной связи для выделения и улучшения конкретных блоков контента, позволяя влиять на то, как они работают в AI-поверхностях.
Заблуждения и критика
В январе 2026 года Дэнни Салливан (Google) высказал мнение, что чанкинг как тактика для повышения видимости в AI-поиске нежелателен. Эта позиция подверглась критике по двум основным направлениям:
Чанкинг и создание контента для пользователей не исключают друг друга — структурирование контента улучшает восприятие как людьми, так и машинами.
Утверждения не соответствуют тому, как функционирует технология RAG и тому, куда движутся будущие технологии.
Критики указывают, что структурированный контент лучше работает в любой парадигме. Исследования Google, Meta, Berkeley и MIT показывают, что по мере развития систем с доступом к большему контексту, памяти и рекурсии структура становится более важной, а не менее.
Распространённый контраргумент о наступлении эры «бесконечного контекста» (модели с окном в 1 млн токенов) также оспаривается: стоимость вывода и глубина рассуждений делают хорошо структурированный, атомарный контент более вычислительно эффективным для обработки.
Влияние на веб-экосистему
От Google-формируемого веба к агент-формируемому
На протяжении двух десятилетий веб адаптировался к тому, что лучше всего работает в Google и Яндекс. Однако с появлением генеративного ИИ сайты больше не адаптируются к единому набору правил — контент теперь формируется под влиянием множества платформ: поисковых систем, AI-ассистентов, рекомендательных систем и социальных лент.
Возникает так называемый агент-формируемый веб (agent-shaped web). Контент больше не пишется преимущественно для удовлетворения одной системы ранжирования, а для того, чтобы быть полезным агентам, которые извлекают, рассуждают над информацией и перекомбинируют её из различных источников. Эти не-Google системы не публикуют руководств и не морализируют тактики — они просто используют контент, который работает.
В этой среде многие практики, которые Google исторически не поощрял, становятся не нарушением, а преимуществом. Когда влияние смещается с ранжирования страниц к снабжению агентов полезными входными данными, контроль фрагментируется.
Программная читаемость
В новой парадигме ключевым понятием становится машиночитаемость (программная читаемость, Programmatic Legibility). Контент проектируется так, чтобы каждый чанк был самодостаточным и содержал собственные сущности, контекст и утверждения. Если пассаж не самодостаточен, он не может корректно «интегрироваться» в память модели и становится зашумлёнными данными.
Агентные системы также становятся всё более мультимодальными, нуждаясь в согласовании текста с изображениями, диаграммами и таблицами. Без структурно-зависимой организации эти связи разрушаются в процессе извлечения.