Реранкер — это второй этап поиска в RAG-пайплайне, который отделяет лучшие 10 результатов от 100 шумных кандидатов. Би-энкодеры (embedding-модели) быстры, но сжимают смысл в один вектор. Кросс-энкодеры читают запрос и документ вместе — медленнее, но точнее. Топ-5 реранкеров 2026: Cohere Rerank 4 (API, 100+ языков), BGE Reranker v2-m3 (Apache 2.0, 17M+ загрузок), Jina Reranker v3 (81.33% Hit@1 при 188ms, 131k контекст), Qwen3 Reranker от 0.6B до 8B параметров и Voyage Rerank 2.5 с доменными адаптациями.

81.33%Hit@1 у Jina v3
17M+загрузок BGE v2-m3
+2-4nDCG@10 domain-tuned
188msлатентность Jina v3

Что такое реранкер и зачем он RAG-пайплайну

Vector search находит 100 документов за миллисекунды. Но «приблизительно» — не значит «правильно». Embedding-модель сжимает весь документ в один вектор, теряя нюансы: синонимы, отрицания, контекстную зависимость запроса от конкретного фрагмента. Реранкер заново оценивает отобранные кандидаты — на этот раз каждой парой «запрос × документ» совместно.

По данным BSWEN, добавление реранкера повышает точность RAG на 10-20% при минимальном увеличении времени ответа. Local AI Master подтверждает: маленькие чанки (256 токенов) с реранкером стабильно бьют большие чанки (1024 токена) без него. Machine Learning Mastery формулирует жёстко: «Хороший поисковик подводит близко. Реранкер даёт правильный ответ. В 2026 реранкер обязателен».

Архитектура двухэтапного поиска выглядит так:

Архитектура RAG с реранкером: bi-encoder → top-100 → cross-encoder → top-10 → LLM

Трёхэтапный пайплайн: быстрый отбор bi-encoder'ом, точное ранжирование cross-encoder'ом, генерация ответа LLM

Bi-encoder против Cross-encoder: почему одного поиска мало

Bi-encoder (embedding-модель) кодирует запрос и документ независимо. Вектор документа вычисляется один раз при индексации — это делает поиск быстрым (миллионы документов в секунду). Но взаимодействие между запросом и документом сводится к косинусной близости двух векторов. Если в документе есть слово «питон», а в запросе «змея» — bi-encoder их не свяжет, если обучался на другом корпусе.

Cross-encoder принимает на вход конкатенацию запроса и документа. Трансформер вычисляет cross-attention между каждым токеном запроса и каждым токеном документа — никакой компрессии, никаких потерь. Particula Tech сравнивает: bi-encoder выполняет O(n) эмбеддингов и O(1) поиск, cross-encoder — O(n) попарное оценивание. ColBERT занимает промежуточное положение: late interaction кодирует отдельно, но на этапе поиска вычисляет поканальное взаимодействие токенов.

На практике: bi-encoder отбирает top-100 или top-500 кандидатов, cross-encoder переранжирует top-10. Это идеальный баланс скорости и качества. Folarin показывает, что кросс-энкодеры дают +2-6 пунктов nDCG@10 даже после хорошего bi-encoder'а.

Реранкер не прощает плохого первого этапа: если bi-encoder пропустил релевантный документ, cross-encoder его не увидит. Поэтому выбор embedding-модели и стратегии чанкинга остаётся критичным — реранкер улучшает порядок, а не охват.

Cohere Rerank 4 Pro и Fast — точность API без хлопот

Cohere — самый зрелый managed-реранкер на рынке. Четвёртое поколение (Rerank 4) вышло в двух версиях: Pro (точность) и Fast (скорость). На Agentset leaderboard Cohere Rerank 4 Pro занимает второе место с рейтингом 5/5, уступая только Zerank 2. Rerank 4 Fast — седьмое место (3.875/5).

Ключевые характеристики:

По данным Particula Tech (май 2026), средняя латентность Cohere Rerank 3.5 составляет 595-603ms. Rerank 4 должен быть быстрее, но конкретных бенчмарков пока нет. Стоимость — per-search, тарифы менялись между Rerank 3 и Rerank 4 (см. текущий прайсинг Cohere). Поддерживает 100+ языков — что делает его лучшим выбором для мультиязычных RAG-систем, включая русскоязычные.

Cohere остаётся лучшим вариантом «ноль усилий»: одна команда API, не нужно настраивать GPU, квантовать веса, бороться с версиями ONNX. Минус — цена вырастает линейно с объёмом запросов. Для high-volume сценариев выгоднее self-hosted альтернативы.

BGE Reranker v2-m3 — мультиязычный open-source стандарт

Флагманская open-source модель от BAAI (Beijing Academy of Artificial Intelligence) — самая популярная реранкер-модель на HuggingFace: более 17 миллионов загрузок и 1076 лайков. Лицензия Apache 2.0 — можно использовать в коммерческих продуктах без ограничений.

BGE Reranker v2-m3 — мультиязычная модель: поддерживает китайский, английский, японский и множество других языков. Показывает конкурентные результаты на MIRACL-бенчмарке — стандарте оценки мультиязычного поиска. На Agentset занимает 11 место (1.5875/5) — но это рейтинг общей экосистемы, а не качества ранжирования; на практике BGE показывает результаты, близкие к Cohere, на тестах внутри одного языка.

Минусы: модель не listwise, а pointwise — оценивает каждую пару запрос-документ независимо. Для русского языка поддерживается, но качество уступает Cohere на 3-5% (субъективные оценки с Reddit). Встраивается в LlamaIndex через FlagEmbeddingReranker, в LangChain через cross-encoder интеграцию.

Jina Reranker v3 — списоквый scoring под 200ms

Главный open-source прорыв 2026 года. По данным Particula Tech (май 2026), Jina Reranker v3 достигает 81.33% Hit@1 при 188ms — единственная топ-модель, укладывающаяся в 200ms. Для сравнения: Nemotron выдаёт 83% Hit@1, но за 243ms (+55ms за 1.7 пункта точности).

Два архитектурных решения отличают Jina v3 от конкурентов:

Во-первых, это listwise scoring: модель принимает сразу 64 документа и оценивает их относительно друг друга, а не по одному. Это ближе к тому, как человек сравнивает варианты. Во-вторых, контекст 131k токенов — можно подавать длинные документы без усечения. Jina позиционирует v3 для long-document RAG, где конкурентам приходится трекать контент.

Предыдущая версия, Jina Reranker v2 Base Multilingual, насчитывает 352 лайка и 1.7M загрузок на HuggingFace — значительная экосистема. Лицензия v2 — CC-BY-NC-4.0, для коммерческого использования необходим API Jina. Версия v3 также доступна через API (per-token тарификация) и on-premise по запросу.

Qwen3 Reranker — модели от 0.6B до 8B под свои ресурсы

Alibaba Cloud выпустила целое семейство реранкеров Qwen3 Reranker — от компактного 0.6B до полноценного 8B параметров. На HuggingFace насчитывают от 146 до 371 лайков на разных размерностях. Все модели под лицензией Apache 2.0 — можно запускать где угодно.

На Agentset leaderboard Qwen3 Reranker 8B занимает 8 место (3.4125/5) — выше, чем BGE v2-m3 и Jina v2. Заявлена поддержка 100+ языков с сильными результатами на китайских и английских корпусах.

Главное преимущество семейства — гибкость по железу: 0.6B версия работает на CPU с ONNX-оптимизацией за 100-300ms на документ. 8B версия требует GPU (8-16 ГБ VRAM в зависимости от квантования) — то есть укладывается в одну consumer-карту. Это делает Qwen3 Reranker привлекательным выбором для self-hosted инсталляций, где нет дорогих серверов.

Voyage Rerank 2.5 — domain-tuned для кода и юриспруденции

Managed-реранкер от Voyage AI. На Agentset занимает 4 место (4.3/5) у полной версии и 6 место (4/5) у облегчённой Lite. Particula Tech отмечает: Voyage Rerank 2.5 совпадает по точности с Cohere на общих корпусах, но добавляет +2-4 nDCG@10 на domain-специфичных данных — особенно кодовых репозиториях (code) и юридических документах (legal).

Voyage AI предлагает отдельные доменные варианты: rerank-2.5-code и rerank-2.5-legal. Если ваш корпус — код на GitHub или контракты — Voyage может дать лучший результат, чем Cohere или Jina, при той же latency. Если корпус — общие тексты на естественном языке — Cohere Rerank 4 или Jina v3 надёжнее.

Ценообразование — per-token, тарифы на сайте Voyage AI. Отдельные лимиты на бесплатный тир.

Сравнительная таблица: все модели рядом

Модель Тип Лицензия Hit@1 Latency Контекст Языки Цена
Cohere Rerank 4 Pro API Closed ~83% ~400-600ms Стандартный 100+ Per-search
BGE Reranker v2-m3 Self-host Apache 2.0 ~78-82% 200-500ms* 512 токенов Мультиязычный Бесплатно
Jina Reranker v3 Self/API CC-BY-NC-4.0 81.33% 188ms 131k токенов Мультиязычный Per-token API
Qwen3 Reranker 8B Self-host Apache 2.0 ~80-84% 200-800ms* 32k токенов 100+ Бесплатно
Voyage Rerank 2.5 API Closed ~81-85%** 300-500ms Стандартный Английский+ Per-token
ColBERTv2 Self-host MIT ~76-80% 50-200ms*** Стандартный Английский Бесплатно

* Зависит от GPU/квантования. ** Domain-tuned до +2-4 nDCG@10. *** Late interaction — быстрее на inference, тяжелее на индексации.

Как выбрать реранкер под свой стек

Выбор реранкера сводится к четырём ограничениям: бюджет на инфраструктуру, лимит latency, языки корпуса и операционная модель. Вот сценарии с конкретными рекомендациями на основе данных Particula Tech и AI App Lab.

Нет GPU, нет желания возиться с инфраструктурой. Единственный разумный выбор — managed API. Cohere Rerank 4 Pro даёт наилучшее покрытие языков (100+) и стабильную latency 400-600ms. Если корпус — код или юридические документы — Voyage Rerank 2.5 с доменным вариантом даст +2-4 nDCG@10. Jina API — третий вариант, если latency критична (188ms).

Жёсткий лимит latency (sub-200ms) и есть GPU. Jina Reranker v3 self-hosted — единственная топ-модель, укладывающаяся в 200ms с Hit@1 выше 81%. Альтернатива с меньшей точностью — Qwen3 Reranker 0.6B на CPU (100-300ms), но качество будет ниже. ColBERTv2 с late interaction может работать быстрее, но требует перестройки пайплайна.

Максимальная точность, latency не критична. Cohere Rerank 4 Pro или Nemotron (83% Hit@1 за 243ms). Если self-host — Qwen3 Reranker 8B на L4 или A10. Для русского языка лучше Cohere (100+ языков) или BGE v2-m3 (мультиязычный, Apache 2.0). Jina v3 с 131k контекста — лучший выбор для длинных документов (тысячи токенов) без трекания.

High-volume, цена API бьёт по бюджету. Self-host: BGE v2-m3 (Apache 2.0, 17M+ загрузок) или Qwen3 Reranker (Apache 2.0, от 0.6B). Никаких per-call расходов — только стоимость GPU. BGE v2-m3 проще в интеграции (прямая поддержка в LlamaIndex и LangChain), Qwen3 8B точнее, но тяжелее. Если нужно обрабатывать 100k+ запросов в день — self-host окупается за неделю.

Длинные документы (больше нескольких тысяч токенов). Jina Reranker v3 — единственный выбор среди open-source с контекстом 131k токенов. Все остальные модели либо трекают вход, либо требуют предварительного чанкинга.

Коротко

Реранкер — обязательный компонент production RAG в 2026 году. Би-энкодер находит 100 кандидатов быстро, кросс-энкодер отбирает 10 лучших точно. Выбор модели зависит от ваших ресурсов и ограничений.

Если у вас нет GPU и вы хотите минимальную операционку — берите Cohere Rerank 4 Pro. Если latency критична — Jina Reranker v3 (81.33% Hit@1 при 188ms). Если важна open-source лицензия и мультиязычность — BGE Reranker v2-m3 (Apache 2.0, 17M+ загрузок). Для доменных задач (код, юриспруденция) — Voyage Rerank 2.5 с domain-tuned вариантами. Для self-host под любые ресурсы — Qwen3 Reranker от 0.6B до 8B.

Но главное правило: бенчмаркайте на своих данных. Публичные цифры (81.33%, 83%, +2-4 nDCG) — ориентировочные. Ваш корпус, типы запросов и стратегия чанкинга определят реальную производительность. Берите 2-3 кандидата из таблицы, меряйте nDCG@10 и Hit@1 на своей выборке — и только потом принимайте решение.

Что ещё важно знать

Реранкер всегда нужен в RAG-пайплайне?

Не всегда. Если corpus маленький (сотни документов) и bi-encoder уже даёт точный top-3 — реранкер избыточен. Также если latency budget ниже 200ms total и bi-encoder хватает цели — скип оправдан. Но для production RAG с тысячами документов реранкер — стандарт.

В чём разница между listwise и pointwise реранкерами?

Pointwise оценивает каждый документ независимо (BGE, Cohere). Listwise (Jina v3) оценивает 64 документа сразу, с учётом их взаимного расположения — точнее, но требует больше памяти на batch.

Какой реранкер лучше всего подходит для русского языка?

Cohere Rerank 4 (100+ языков) — лучший managed-вариант. BGE v2-m3 — лучший open-source с мультиязычной поддержкой. Jina v2/v3 также поддерживают русский. Для русского языка избегайте ColBERTv2 (только английский).

Сколько GPU нужно для self-hosted реранкера?

BGE v2-m3 работает на consumer GPU (4-8 ГБ). Qwen3 0.6B — на CPU. Qwen3 8B — 8-16 ГБ VRAM в зависимости от квантования. Jina v3 — 8-16 ГБ. ColBERTv2 — 4-8 ГБ.

Как протестировать реранкер на своих данных?

Соберите 50-100 запросов с известными релевантными документами. Запустите bi-encoder поиск (top-100), затем примените реранкер. Измерьте nDCG@10 и Hit@1. BSWEN рекомендует держать поиск постоянным и менять только реранкер — так вы изолируете эффект.