Passage Retrieval
Passage Retrieval — это метод информационного поиска, при котором система ищет и возвращает не целые документы, а отдельные смысловые фрагменты (пассажи) текста, наиболее релевантные запросу пользователя. Пассаж — это обычно абзац, несколько предложений или блок до 200–500 токенов, который содержит законченную мысль. В отличие от классического document retrieval, где результатом становится ссылка на страницу целиком, passage retrieval отдаёт точный ответ или его фрагмент, что критично для RAG-систем, чат-ботов и голосовых ассистентов.
Как работает passage retrieval
- Индексация: исходные документы разбиваются на пассажи фиксированной или семантической длины (например, 128–512 токенов с перекрытием 10–20%).
- Векторизация: каждый пассаж кодируется моделью (BM25, dense-энкодеры типа E5, BGE, Contriever) в числовой вектор.
- Поиск: запрос пользователя преобразуется в вектор, и система находит ближайшие пассажи по косинусной близости или через ANN-индекс (HNSW, FAISS).
- Ранжирование: топ-100 кандидатов пересортировываются кросс-энкодером (reranker), который оценивает пару «запрос–пассаж» и поднимает самые точные фрагменты.
- Выдача: 3–10 лучших пассажей передаются в LLM или показываются пользователю как готовый ответ.
Где применяется на практике
- RAG-системы: пассажи становятся контекстом для генерации ответа, снижая галлюцинации модели.
- Корпоративный поиск: сотрудник получает не список файлов, а конкретный абзац из регламента или договора.
- Юридический и медицинский поиск: точность критична, поэтому passage retrieval комбинируют с sparse retrieval и dense retrieval в гибридных схемах.
- E-commerce: поиск по описаниям товаров, характеристикам и отзывам, где важен фрагмент, а не вся карточка.
- Поддержка клиентов: бот находит нужный пункт инструкции за миллисекунды вместо пересказа всего документа.
Метрики и типичные ошибки
- Recall@k и MRR — показывают, попал ли правильный пассаж в топ-k и на какую позицию.
- NDCG — учитывает порядок выдачи с учётом релевантности.
- Слишком крупные пассажи размывают вектор и снижают точность; слишком мелкие теряют контекст.
- Отсутствие перекрытия между чанками приводит к разрыву смысла на границах.
- Игнорирование reranker'а даёт приемлемый recall, но плохую точность первых позиций.
Для сайтов с большим объёмом контента passage retrieval напрямую влияет на видимость в AI-поиске: LLM-ассистенты цитируют именно фрагменты, а не страницы. Поэтому структурирование текста, короткие абзацы и чёткие подзаголовки повышают шанс попасть в ответ. Настроить такую оптимизацию помогает GEO продвижение, а техническую базу — техническая GEO оптимизация. Связанные темы: Passage Ranking, Retrieval, RAG, Semantic Retrieval.
