Реранкер (англ. reranker) — это компонент поисковой системы или RAG-пайплайна, который выполняет повторную сортировку предварительно отобранного небольшого набора документов или текстовых фрагментов (кандидатов), присваивая каждому пару «запрос–документ» более точную оценку релевантности, чем это сделано на этапе первичного поиска.
В отличие от быстрых методов первого этапа (BM25, векторные би-энкодеры), реранкер обычно использует кросс-энкодер — нейросеть, которая читает запрос и кандидата совместно, учитывая все попарные взаимодействия между словами, что даёт высокую точность, но требует значительных вычислительных ресурсов и поэтому применяется только к ограниченному числу кандидатов (десятки–сотни). Конечная цель реранкера — подать на вход генеративной LLM наиболее релевантные фрагменты, чтобы итоговый ответ был точным и содержал нужные источники.
Переранжирование (от англ. reranking), или повторное ранжирование — в информационном поиске и системах с генерацией ответов на основе поиска (RAG) этап обработки, на котором предварительно отобранный набор кандидатов (документов или фрагментов текста) заново оценивается и упорядочивается по релевантности относительно исходного запроса пользователя. Ранжирование является промежуточным звеном между этапом первичного поиска (широкого охвата) и этапом генерации итогового ответа.
История
Концепция повторного ранжирования результатов поиска существует с первых дней развития информационно-поисковых систем. Однако значительный прорыв произошёл в 2018 году с выходом модели BERT (Bidirectional Encoder Representations from Transformers), разработанной компанией Google. BERT стала первой широко распространённой языковой моделью, способной читать текст в обоих направлениях одновременно, что позволило учитывать контекст каждого слова.
В 2019 году Google и Microsoft официально подтвердили использование трансформерных методов в своих поисковых системах. В 2020 году Microsoft выпустила семейство моделей MiniLM — дистиллированных версий BERT, которые сохраняют большую часть точности при значительно меньшем размере и вычислительных затратах.
Важным этапом стало появление в 2021 году модели SPLADE от Naver Labs Europe, предложившей интерпретируемый подход к ранжированию на основе взвешенного лексикона. В том же году Стэнфордский университет представил ColBERT — модель с механизмом «позднего взаимодействия» (late interaction), занимающую промежуточное положение между би- и кросс-энкодерами.
В 2025 году компания Alibaba выпустила Qwen3-Reranker — семейство моделей ранжирования на основе генеративных больших языковых моделей (LLM), что ознаменовало переход от чисто энкодерных архитектур к использованию декодерных LLM в качестве оценщиков релевантности.
Архитектура поискового конвейера
В современных системах поиска и генерации ответов обработка запроса проходит несколько последовательных этапов:
Планирование запроса. Исходный вопрос пользователя переформулируется и часто разделяется на несколько поисковых подзапросов для более полного охвата релевантной информации.
Первичный поиск (широкий охват). Обычно выполняются два типа поиска:
Ключевой поиск (BM25 или аналоги) — сопоставление по точным словам.
Векторный поиск (эмбеддинги) — поиск по смыслу, когда тексты преобразуются в числовые векторы.
Результаты двух списков объединяются, как правило, методом Reciprocal Rank Fusion (RRF).
Ранжирование (тонкая сортировка). Короткий список кандидатов (от десятков до сотен) заново оценивается моделью, которая считывает запрос и каждый фрагмент текста совместно, присваивая оценку релевантности.
Генерация ответа. Большая языковая модель (LLM) формирует итоговый ответ на основе отобранных фрагментов и может цитировать некоторые из них.
Таким образом, первичный поиск определяет, попадает ли фрагмент в набор кандидатов, ранжирование помогает решить, какие кандидаты выживают, а генерация определяет, что именно использует и цитирует итоговый ответ.
Принцип работы
Би-энкодеры и кросс-энкодеры
Ключевое различие в архитектурах ранжирования связано с тем, как модель обрабатывает запрос и документ:
Би-энкодеры обрабатывают запрос и документ раздельно, превращая каждый в один вектор, который затем сравнивается с помощью простых математических операций (косинусное сходство или скалярное произведение). Документы могут быть закодированы заранее, что обеспечивает высокую скорость поиска среди миллионов документов. Однако точность снижается, так как каждое взаимодействие между запросом и документом сжимается в один вектор до того, как модель «увидит» другой текст.
Кросс-энкодеры (основа большинства ранкеров) подают запрос и фрагмент текста в модель совместно, как единый вход. Каждое слово запроса может взаимодействовать с каждым словом фрагмента через всю нейронную сеть, что даёт значительно более высокую точность. Платой за это является скорость: каждая пара запрос-фрагмент требует отдельного полного прогона модели, и ничего нельзя вычислить заранее.
Именно поэтому поисковый конвейер работает в два этапа: би-энкодеры (и BM25) обеспечивают широкий охват с малой стоимостью, а кросс-энкодеры дорого переоценивают короткий список. Би-энкодер отвечает на вопрос «может ли этот фрагмент быть релевантным?», а кросс-энкодер — «насколько хорошо этот фрагмент удовлетворяет запрос по сравнению с другими кандидатами?».
Оценка релевантности
В классическом кросс-энкодере модель сжимает пару запрос-фрагмент в одну оценку релевантности, часто представляемую в процентах для удобства сортировки. Важно понимать: эти проценты предназначены для ранжирования фрагментов друг относительно друга в рамках одной модели и одного запроса, но не гарантируют цитирования в итоговом ответе.
Помимо нейронной оценки релевантности, на итоговый выбор источника могут влиять авторитетность, свежесть, качество источника, полнота поискового охвата, правила диверсификации и поведение финальной LLM.
Основные семейства моделей
Классические кросс-энкодеры на основе BERT
Большинство классических англоязычных ранкеров дообучались на наборе данных MS MARCO — корпусе анонимизированных поисковых запросов Bing и размеченных экспертами ответов. К этому семейству относятся:
ms-marco-MiniLM-L-6-v2 (≈23 млн параметров, 6 слоёв) и ms-marco-MiniLM-L-12-v2 (≈33 млн, 12 слоёв) — компактные кросс-энкодеры, работающие на CPU.
ms-marco-TinyBERT-L-2-v2 (≈4 млн параметров, 2 слоя) — настолько мал, что может использоваться для предварительной фильтрации множества кандидатов перед более сильной моделью.
ms-marco-electra-base (110M) — представитель семейства ELECTRA от Google, обучавшегося не на угадывании замаскированных слов, а на обнаружении подменённых слов в предложении.
Многоязычные модели
BGE-reranker-base (278M) и BGE-reranker-large (560M) от Пекинской академии искусственного интеллекта (BAAI) — дообученные модели XLM-RoBERTa, поддерживающие 100+ языков. Являются одними из самых популярных открытых ранкеров.
BGE-reranker-v2-m3 (568M) — более новая версия на базе BGE-M3, поддерживает 100+ языков и более длинные входные данные.
Интерпретируемые модели
SPLADE (Naver Labs Europe, 2021) — одна из наиболее интерпретируемых моделей для диагностики содержимого. Она преобразует текст во взвешенный набор лексических терминов, а оценка релевантности вычисляется как сумма произведений весов общих терминов запроса и фрагмента. SPLADE показывает, каких терминов не хватает во фрагменте.
ColBERT (Stanford, 2020) — использует механизм «позднего взаимодействия»: каждый токен запроса ищет в документе наиболее подходящий токен, а оценка вычисляется как сумма наилучших соответствий (MaxSim). Показывает, какие концепции запроса не находят сильного соответствия в тексте.
LLM-ранкеры нового поколения
Qwen3-Reranker (Alibaba, 2025) — семейство моделей на основе декодерных LLM, выпускаемых в размерах 0.6B, 4B и 8B параметров. Вместо BERT-архитектуры используется генеративная LLM, которой даётся инструкция: «Запрос: … Документ: … Отвечает ли документ на запрос? Ответьте да или нет». Эти модели:
обрабатывают длинные документы (до 32 000 токенов у Qwen3-Reranker против 512 у классических BERT-ранкеров);
работают со 100+ языками и кодом;
находятся на вершине многоязычных бенчмарков.
Однако они в 10–100 раз тяжелее MiniLM, а их внутренние механизмы труднее поддаются интерпретации.
ModernBERT (декабрь 2024) — обновление энкодерной архитектуры с окном контекста в 8 192 токена (в 16 раз больше оригинального BERT). Ettin (Johns Hopkins, 2025) — семейство энкодеров, обученных по рецепту ModernBERT.
Применение
Диагностика содержимого
Ранкеры используются для диагностики того, почему контент не цитируется системами ИИ-поиска. Различные модели дают разные типы информации:
Кросс-энкодеры — лучшие для оценки относительной релевантности.
SPLADE — показывает точный список сопоставленных и отсутствующих терминов с весами.
ColBERT — показывает, какие концепции запроса не находят сильного партнёра в тексте.
LLM-ранкеры — для сложной или инструктивной релевантности.
Практические рекомендации по выбору модели
Для понимания причин низкой оценки: использовать SPLADE, затем ColBERT.
Для максимальной точности ранжирования (высокая стоимость допустима): использовать Qwen3-Reranker (4B или 8B) наряду с API-решениями.
Для высокой скорости на недорогом оборудовании: начать с ms-marco-MiniLM-L-6-v2 (23M).
Для неанглоязычного контента: использовать BGE-reranker-v2-m3 или Qwen3-Reranker.
Для длинных документов: использовать ModernBERT/Ettin или LLM-ранкеры.
Критика и ограничения
Ранкеры, основанные на BERT-архитектурах, имеют ограничение по длине контекста — классические модели принимают только до 512 токенов (≈350 слов), что не позволяет им «видеть» большую часть длинной статьи.
Внимание BERT-моделей частично смещено на знаки пунктуации и служебные токены — в измерениях BGE-reranker-large около 24% внимания приходится на знаки пунктуации и специальные токены. Это означает, что визуализации внимания (тепловые карты) следует интерпретировать с осторожностью — скопления подсвеченных слов имеют смысл, но отдельное слово часто не является показательным.
Оценки релевантности от разных моделей несопоставимы между собой как универсальный процент — они нормализованы в рамках каждой модели. Расхождение между моделями — повод исследовать фрагмент, а не усреднять несовместимые оценки.
Нет публичных доказательств того, какая именно открытая модель используется в ChatGPT, Google AI Overviews или Perplexity. Однако форма поискового конвейера (гибридный ключевой и векторный поиск с последующим ранжированием) соответствует отраслевому стандарту, задокументированному в OpenAI File Search и многих открытых RAG-стеках.
Реранкеры и практика SEO
Связь между SEO и реранкерами — это сложный и часто неправильно понимаемый вопрос. Ключевой вывод можно сформулировать так: реранкеры не являются инструментом для прямого улучшения SEO, но понимание принципов их работы становится критически важным для SEO-стратегии в эпоху ИИ-поиска.
Вот как это работает на практике.
Реранкер не улучшит SEO
Важно понимать, что SEO и реранкеры решают разные задачи и находятся «по разные стороны стола».
Кто использует реранкеры? Разработчики поисковых систем (как Google) и создатели RAG-приложений (как ChatGPT). Их цель — отобрать и отсортировать уже найденные документы, чтобы выдать пользователю самый релевантный ответ.
Кто занимается SEO? Владельцы сайтов и контент-менеджеры. Их цель — сделать свой контент максимально релевантным и авторитетным, чтобы поисковая система выбрала именно его.
Исходя из этого, вы не можете напрямую повлиять на реранкер, чтобы он продвинул ваш сайт. Это внутренний механизм поисковика. Например, функция Brave Search, позволяющая пользователям вручную поднимать или убирать сайты из выдачи, не влияет на ранжирование для других пользователей и, следовательно, не является частью SEO-стратегии.
Понимание реранкеров формирует SEO-стратегию
Хотя вы не можете управлять реранкером, вы можете оптимизировать свой контент так, чтобы он счел его максимально релевантным. Это и есть новая парадигма SEO, которую иногда называют GEO (Generative Engine Optimization) — оптимизация для генеративных ИИ-систем.
Чтобы ваш контент прошел «фильтр» реранкера, он должен соответствовать его критериям. Эти критерии косвенно связаны с традиционными SEO-факторами:
Релевантность и качество контента. Реранкеры оценивают семантическую связь между запросом и документом. Чем точнее ваш контент отвечает на запрос, тем выше его шансы. Это требует глубокой проработки темы, а не поверхностного рерайта.
Поведенческие факторы. Поисковые системы учитывают, как пользователи взаимодействуют с сайтом. Высокий CTR (кликабельность), низкий показатель отказов и долгое время на странице — это сигналы релевантности, которые могут влиять на переранжирование.
Свежесть и авторитетность. Реранкеры могут отдавать предпочтение более свежим данным и авторитетным источникам. Это стимулирует регулярное обновление контента и работу над профилем обратных ссылок.
Общие выводы
Таким образом, SEO-специалисту важно сместить фокус:
От «манипуляции алгоритмом» к «созданию лучшего ответа». Цель — не просто занять высокую позицию, а стать тем источником, который реранкер сочтет самым полезным для пользователя.
От «ключевых слов» к «смыслу и интенту». Оптимизация под реранкеры требует работы с семантикой, полного и структурированного раскрытия темы, чтобы контент был идеальным кандидатом для цитирования ИИ-ассистентом.
Понимая, как работают реранкеры, можно выстроить SEO-стратегию, которая сделает ваш контент максимально привлекательным для этого «ящика», обеспечив вам место в результатах поиска нового поколения.