Релевантность поиска — это показатель того, насколько тесно документ связан с запросом. Релевантность может определяться самыми разными способами: от простой двоичной релевантности до алгоритма взвешенной релевантности, такого как TF-IDF , который присваивает документам оценку релевантности. Она определяет, насколько актуальным и полезным является документ для удовлетворения потребностей пользователя.
Инженерия релевантности — это практика построения семантической релевантности страницы запросу с помощью эмбеддингов и векторной математики, рассматривающая видимость в поисковой выдаче как инженерную задачу, а не как оптимизацию ключевых слов. В то время как традиционная SEO-оптимизация настраивает ключевые слова, заголовки и ссылки, инженерия релевантности работает непосредственно со смыслом: темы, страницы и запросы преобразуются в векторные представления, а релевантность измеряется тем, насколько близко эти векторы расположены друг к другу.
Как это работает
Смысл, а не ключевые слова. Контент и запросы представлены в виде векторов, отражающих смысл, в соответствии с переходом от лексического к семантическому поиску.
Для каждой темы существует свой центр. Каждая ключевая тема представлена средним центральным вектором, поэтому любую страницу можно оценить по нему.
Близость как показатель. Расстояние между вектором страницы и целевой темой дает показатель релевантности, а не предположение.
Решения принимаются на основе полученных результатов. Эти цифры определяют, что писать, что удалять, как группировать страницы и как их связывать. Экспертизу можно измерить таким же образом, усреднив векторы всего, что опубликовал автор или сайт.
Как оценивается релевантность
Оценка релевантности — это числовое значение, присвоенное документу, которое указывает, насколько релевантный документ соответствует данному запросу . Оценки релевантности используются для упорядочивания результатов в поисковой выдаче и могут рассчитываться с помощью широкого спектра различных моделей релевантности. Оценки релевантности отличаются от более элементарных моделей релевантности, таких как бинарная релевантность, которая просто определяет, является ли документ релевантным для запроса, без присвоения документу какой-либо оценки.
При поиске в поисковой системе пользователь вводит запрос, который может состоять из одного или нескольких ключевых слов или фраз. Задача поисковой системы – найти и предоставить наиболее релевантные документы, которые соответствуют запросу пользователя.
Релевантность — это одна из множества метрик, используемых в функции ранжирования, но одна из важнейших, зависящих от запроса, которые определяют, какие страницы входят в эталонный корпус.
Как поисковая система определяет релевантность
Поисковая система – представляет собой математическую среду, поэтому любая качественная характеристика должна быть определена с помощью количественного анализа. Это касается и расчёта релевантности как сложной многомерной метрики.
Любая поисковая система работает на модели векторного пространства. И запрос, и документы из списка поисковой выдачи представляются в виде векторов в многомерном пространстве. Векторы документов, наиболее близких к вектору запроса, рассматриваются как релевантные. Это чисто математическая операция, в которой мерой релевантности считается косинусная близость.
Косинусная близость измеряет косинус угла между двумя векторами в диапазоне от -1 до 1. -1 означает диаметральную противоположность. Ноль – отсутствие сходства. Результат 1 означает идентичность векторов.
На практике это означает, что с точки зрения поискового алгоритма значение имеют только количественные показатели, а не качественные. Иными словами, качественные метрики вторичны по отношению к количественным: экспертный статус автора, объём контента, дизайн оформления не определяют соответствие документа запросу.
Релевантность определяется функцией расстояния между эмбеддингами (вложениями). Для вычисления используются несколько способов:
С помощью сравнения эмбеддингов ключевых слов и эмбеддингов конкретных документов можно определить релевантность страниц заданным ключевым словам. Для этого можно сопоставлять анализируемый сайт или документ с некоторым эталонным сайтом или документом.
Этот же инструментарий используется для оценки релевантности ссылок: если связь между двумя документами низка, то и ссылка имеет малую ценность. Благодаря такому подходу можно автоматически определять страницы-доноры и страницы-реципиенты – вне зависимости от объёма сайта. На базе этого же подходя можно устанавливать постоянные перенаправления (301 редиректы) при переезде сайта на другой домен.
Пример вычисление косинусной близости средствами Python
В этой программе используются косинусное подобие и модуль инструментария nltk.
import nltk
# Вычисление сходства двух фраз
# с использованием косинусного сходства.
from nltk.corpus import stopwords
from nltk.tokenize import word_tokenize
# X = input("Первая фраза: ").lower()
# Y = input("Вторая фраза: ").lower()
X ="Кошка прыгнула на пол"
Y ="Кошка лежит на ковре"
# tokenization
X_list = word_tokenize(X)
Y_list = word_tokenize(Y)
# sw contains the list of stopwords
sw = stopwords.words('russian')
l1 =[];l2 =[]
# remove stop words from the string
X_set = {w for w in X_list if not w in sw}
Y_set = {w for w in Y_list if not w in sw}
# form a set containing keywords of both strings
rvector = X_set.union(Y_set)
for w in rvector:
if w in X_set: l1.append(1) # create a vector
else: l1.append(0)
if w in Y_set: l2.append(1)
else: l2.append(0)
c = 0
# cosine formula
for i in range(len(rvector)):
c+= l1[i]*l2[i]
cosine = c / float((sum(l1)*sum(l2))**0.5)
print("Сходство: ", cosine)
Результат из примера: Сходство: 0.3333333333333333
Пример сопоставления посадочных страниц поисковому запросу
На базе косинусной близости можно выявить похожие страницы, соответствующие одному и тому же запросу в большей или меньшей степени. Для этого вычисляются эмбеддинги страниц и сопоставляются с эмбеддингами запросов. Это можно использовать для устранения проблем с каннибализацией запросов, семантическим дублированием, для определения схем внутренней перелинковки и т.п.
BERTopic как актуальный инструмент комплексной оценки релевантности
BERTopic — это современный инструмент на основе NLP (обработки естественного языка), который кардинально меняет подход к оценке релевантности сайта. В отличие от классических методов, он позволяет перейти от анализа отдельных ключевых слов к пониманию смысловых тем (топиков), что критически важно для SEO в эпоху семантического поиска Google. Вот как это работает и в чем его ключевое преимущество перед устаревшими методами вроде LDA (Latent Dirichlet Allocation):
Алгоритм работает с контекстом, а не отдельными ключевыми словами. Устаревшие семантические алгоритмы анализируют частоту совместной встречаемости слов («мешок слов»), игнорируя порядок и контекст. Например, «Python»-язык и «Python»-змея — одно и то же. BERTopic же понимает смысл слова в контексте предложения, что дает гораздо более точные и осмысленные тематические кластеры.
BERTopic преобразует текст в многомерные векторы (эмбеддинги), сжимает их размерность с помощью UMAP, находит плотные группы схожих документов через кластеризацию HDBSCAN и, наконец, выделяет ключевые слова, наиболее точно описывающие каждый кластер, с помощью специального взвешивания c-TF-IDF.
Исследования показывают, что BERTopic генерирует более связные, разнообразные и интерпретируемые темы по сравнению с LDA, NMF и другими классическими алгоритмами.
Пример оценки содержания сайта: очевидно, что он устойчиво разваливается на две несвязанные между собой темы, между которых нет никаких промежуточных тем
BERTopic позволяет SEO-специалистам анализировать большие объемы неструктурированных данных и принимать решения на основе семантики. Его основные применения включают:
Анализ тематического покрытия (Topical Coverage). Можно загрузить в BERTopic все страницы своего сайта и получить карту тем, которые он охватывает. Это позволяет объективно увидеть, какие темы раскрыты хорошо, а какие — поверхностно или отсутствуют вовсе.
Выявление семантических пробелов (Gap Analysis). Сравнив тематические кластеры своего сайта и сайтов конкурентов, можно точно определить, каких важных смысловых блоков не хватает именно вам. Это дает конкретные идеи для создания нового контента.
Кластеризация поисковых запросов. Вместо ручной группировки тысяч ключевых слов, BERTopic может автоматически разбить ваше семантическое ядро на тематические кластеры. Это основа для построения правильной структуры сайта и распределения запросов по посадочным страницам.
Оптимизация структуры сайта. Результаты кластеризации можно напрямую использовать для создания логичной иерархии разделов и подразделов, которая будет понятна не только пользователям, но и поисковым системам.
Аудит контента и внутренняя перелинковка. BERTopic может автоматически промаркировать все страницы сайта темами, которым они соответствуют. Это значительно ускоряет аудит, помогает выявить дублирующийся или похожий контент для его консолидации, а также дает умные подсказки для построения релевантной внутренней перелинковки.