Semantic Similarity
Semantic Similarity (семантическая близость) — это численная мера того, насколько близки по смыслу два фрагмента текста, независимо от совпадения отдельных слов. Если классический поиск сравнивает строки по буквам, то semantic similarity сравнивает смысл: фразы «купить недорогой смартфон» и «приобрести бюджетный телефон» получают высокую оценку близости, хотя общих слов в них почти нет. Технически это реализуется через векторные представления (эмбеддинги): модель кодирует текст в набор чисел, а близость вычисляется как косинус угла между векторами — обычно в диапазоне от 0 до 1.
Как это работает на практике
- Текст (запрос, абзац, заголовок) пропускается через языковую модель — например, через эмбеддинг-модель на базе трансформеров.
- На выходе получается вектор фиксированной размерности: 384, 768 или 1536 чисел в зависимости от модели.
- Для пары текстов считается косинусная близость: чем ближе значение к 1, тем более схожи смыслы; значения около 0 означают смысловую несвязанность.
- Порог отсечения подбирается под задачу: для дедупликации статей часто берут 0.9, для подбора похожих товаров — 0.75.
Где применяется в SEO и контенте
- Кластеризация семантического ядра: запросы группируются не по вхождениям слов, а по смыслу — это точнее, чем ручная группировка, и ускоряет сбор семантики.
- Поиск дублей и каннибализации: страницы с близостью выше 0.9 почти наверняка конкурируют за один и тот же интент, их стоит объединить или развести.
- Внутренняя перелинковка: похожие по смыслу материалы связываются автоматически, что усиливает оптимизацию сайта.
- Подбор LSI-слов и проверка релевантности текста запросу без опоры на точные вхождения.
Ограничения метрики
- Модель не различает антонимы: «дешёвый» и «дорогой» могут оказаться близки, если обучающий корпус ставил их в похожие контексты.
- Результат зависит от выбранной модели и языка: русскоязычные эмбеддинги дают заметно другую картину, чем мультиязычные.
- Высокая близость не равна релевантности: два текста могут быть «про одно и то же», но один — коммерческим, а другой — информационным.
Semantic similarity лежит в основе современного поиска и рекомендательных систем: её используют Semantic Search для ранжирования результатов, Semantic Retrieval — для извлечения документов из базы знаний, а Cosine Similarity служит стандартной формулой для расчёта самой метрики. При разбивке больших текстов на фрагменты перед индексацией применяется Semantic Chunking, чтобы каждый чанк сохранял целостный смысл.
