Перейти к содержимому
Позвоните нам, чтобы обсудить ваш проект!

Passage Retrieval


Passage Retrieval — это метод информационного поиска, при котором система ищет и возвращает не целые документы, а отдельные смысловые фрагменты (пассажи) текста, наиболее релевантные запросу пользователя. Пассаж — это обычно абзац, несколько предложений или блок до 200–500 токенов, который содержит законченную мысль. В отличие от классического document retrieval, где результатом становится ссылка на страницу целиком, passage retrieval отдаёт точный ответ или его фрагмент, что критично для RAG-систем, чат-ботов и голосовых ассистентов.

Как работает passage retrieval

  • Индексация: исходные документы разбиваются на пассажи фиксированной или семантической длины (например, 128–512 токенов с перекрытием 10–20%).
  • Векторизация: каждый пассаж кодируется моделью (BM25, dense-энкодеры типа E5, BGE, Contriever) в числовой вектор.
  • Поиск: запрос пользователя преобразуется в вектор, и система находит ближайшие пассажи по косинусной близости или через ANN-индекс (HNSW, FAISS).
  • Ранжирование: топ-100 кандидатов пересортировываются кросс-энкодером (reranker), который оценивает пару «запрос–пассаж» и поднимает самые точные фрагменты.
  • Выдача: 3–10 лучших пассажей передаются в LLM или показываются пользователю как готовый ответ.

Где применяется на практике

  • RAG-системы: пассажи становятся контекстом для генерации ответа, снижая галлюцинации модели.
  • Корпоративный поиск: сотрудник получает не список файлов, а конкретный абзац из регламента или договора.
  • Юридический и медицинский поиск: точность критична, поэтому passage retrieval комбинируют с sparse retrieval и dense retrieval в гибридных схемах.
  • E-commerce: поиск по описаниям товаров, характеристикам и отзывам, где важен фрагмент, а не вся карточка.
  • Поддержка клиентов: бот находит нужный пункт инструкции за миллисекунды вместо пересказа всего документа.

Метрики и типичные ошибки

  • Recall@k и MRR — показывают, попал ли правильный пассаж в топ-k и на какую позицию.
  • NDCG — учитывает порядок выдачи с учётом релевантности.
  • Слишком крупные пассажи размывают вектор и снижают точность; слишком мелкие теряют контекст.
  • Отсутствие перекрытия между чанками приводит к разрыву смысла на границах.
  • Игнорирование reranker'а даёт приемлемый recall, но плохую точность первых позиций.

Для сайтов с большим объёмом контента passage retrieval напрямую влияет на видимость в AI-поиске: LLM-ассистенты цитируют именно фрагменты, а не страницы. Поэтому структурирование текста, короткие абзацы и чёткие подзаголовки повышают шанс попасть в ответ. Настроить такую оптимизацию помогает GEO продвижение, а техническую базу — техническая GEO оптимизация. Связанные темы: Passage Ranking, Retrieval, RAG, Semantic Retrieval.


Еще на эту тему