Разбор доклада • AI Engineer World's Fair

Необоснованная эффективность BM25 в агентном поиске

Почему 30-летняя лексическая функция оценки переживает колоссальный ренессанс в эпоху автономных AI-агентов, как переписать запросы с эффективностью GPT-5 и почему архитектура «BM25 + ripgrep» бьет сложные нейропоисковые пайплайны.

👤 Спикер: Ю Кристьян Бергум (Jo Kristian Bergum)
🏢 Компания: CEO Hornet.dev (экс-Vespa, Yahoo, FAST)
⏱️ Длительность: 18:28 (1108 сек)
📍 Трек: Search & Retrieval (Июнь 2026)
👀 Просмотры: 20.9k
Постер доклада: The unreasonable effectiveness of BM25 for agentic search

Главный парадокс доклада

«BM25 не стал внезапно магическим. Изменилась не формула — изменился пользователь. Вместо ленивого человека с 2 словами в строке поиска мы получили AI-агента, знающего миллионы сущностей и строящего изощренные многошаговые сессии».

Смотреть оригинал на YouTube
TL;DR

Краткая выжимка: 4 столпа нового поиска

Ключевые инсайты доклада для тех, кто строит агентов, RAG-системы и инфраструктуру поиска.

01 // НОВЫЙ ПОЛЬЗОВАТЕЛЬ

Агент не похож на человека

Люди со времен логов AOL 2006 года пишут 2–3 слова. LLM-агент формулирует запросы медианой в 10 слов, использует операторы site:, точные фразы в кавычках и перезапускает поиск десятками итераций.

02 // ОГРАНИЧЕНИЕ КОНТЕКСТА

Окно контекста — дискета 1.44 МБ

Рабочий контекст без деградации рассуждений (context rot) — ~350K токенов (1.4 МБ текста). Это всего 0.05% от типичного веб-корпуса. Ретривер критически важен, чтобы решить, что именно попадет на эту «дискету».

03 // WHICH BM25?

Тюнинг параметров дает +18%

Бенчмарки объявляли BM25 устаревшим, тестируя его с дефолтными k1=0.9, b=0.4. Подбор параметров под длинные документы (k1=25, b=1) поднимает точность ответов агента с 64% до 82%.

04 // ПАТТЕРН БУДУЩЕГО

BM25 + ripgrep в песочнице

Вместо передачи агенту готовых списков ссылок: BM25 отбирает кандидатов в виртуальную файловую систему (VFS), а агент исследует их через rg, cat и head, добиваясь точности 73.3%.

Концепция и компоненты

Что такое Agentic Search и как устроен его цикл

Поиск перестал быть отдельным сервисом с 10 синими ссылками. Теперь это непрерывный внутренний цикл агента.

Ю Кристьян Бергум определяет Agentic Search как «поиск внутри агентного цикла» (search inside an agent loop). Агент сталкивается с задачей (глубокое исследование темы, кодинг, решение многошаговой проблемы) и обнаруживает потребность в информации.

01 / MODEL Capable LLM • Оценивает потребность в данных • Формулирует точные запросы • Использует синтаксис (site:, "") • Обладает параметрическим знанием фактов и сущностей • Читает сниппеты и решает дальше plans 02 / HARNESS Agent Harness • Контракт тулов: search(q), read() • Управление контекстом и бюджетом • Ограничение числа вызовов и $ • Поддержка tool-calling / Code Mode • Монтирование результатов в VFS calls 03 / RETRIEVER BM25 Engine • Инвертированный индекс • Алгоритмы WAND / Block-Max • Дешевый отбор Top-K кандидатов • Масштабирование на 100M+ доков • Обработка десятков запросов/сек feedback: evidence snippets & files return to LLM loop
Триединство агентного поиска: LLM планирует → Harness ограничивает бюджет → Ретривер молниеносно фильтрует кандидатов. ⏱️ 01:07

1. Модель (LLM)

Не просто отвечает, а решает, когда искать. Она способна переформулировать запросы на основе первых неудач, вычленять сущности и понимать, каких доказательств не хватает для завершения рассуждения.

2. Среда (Harness)

Оркестратор, предоставляющий инструменты: либо классический JSON tool-calling (search(query)), либо Code Mode (песочница с Bash/Python, где модель пишет код для поиска). Следит за контекстом и стоимостью.

3. Поисковый движок

Быстрый лексический индекс на базе BM25 (с WAND/Block-Max оптимизацией), способный обслуживать высокую частоту повторных обращений на корпусах в миллионы и миллиарды веб-страниц.

Память vs Корпус

Метафора дискеты: проблема Context Rot и 0.05% корпуса

Почему расширение контекстных окон LLM до 1–2M токенов не решает проблему поиска.

В 1980-х игры и программы устанавливали с 3.5-дюймовых дискет емкостью 1.44 МБ. В пересчете на текст на английском языке (примерно 4 байта на токен) это составляет ~350 000 – 370 000 токенов.

Хотя современные модели заявляют контекст в 1M или 2M токенов, на практике после 350k токенов начинается резкое падение качества логического вывода — context rot (гниение контекста).

В тестовом корпусе бенчмарка BrowseComp-Plus содержится 736 млн токенов. Практическое окно модели способно вместить не более 0.05% от этого объема данных. Вы не можете просто «засунуть все в контекст».

~0.05%
Доля корпуса, умещающаяся в контекст до наступления context rot
1.44 МБ дискета (~360k токенов) против 736M токенов в BrowseComp-Plus
Слайд: Before context rot: one floppy disk worth of context
Нажмите для увеличения
📺 В видео [06:01]: Визуализация корпуса 736M токенов и дискеты на 1.44 МБ. Ретривер — это привратник, который выбирает кусочек размером с дискету, над которым модель будет рассуждать.
⏱️ 06:01
Бенчмарк BrowseComp-Plus

Узкое место — не рассуждения, а поиск

Результаты исследования BrowseComp-Plus (ACL 2026): 830 сложных загадок на 100 195 веб-страницах.

Бенчмарк BrowseComp-Plus ставит перед агентом задачи, похожие на «вопросы из барной викторины» (pub quiz riddles). Это многошаговые запутанные вопросы, требующие найти несколько взаимосвязанных фактов в веб-архиве из 100 195 документов.

Схема бенчмарка BrowseComp-Plus
Нажмите для увеличения
📺 В видео [04:52]: Пайплайн бенчмарка BrowseComp-Plus (830 вопросов с жестким золотым эталоном ответов, 100k веб-страниц).
⏱️ 04:52
55.9%
Retriever A (Baseline)
Тот же агентный цикл, базовое качество поиска улик
70.1%
Retriever B (Улучшенный)
Тот же агентный цикл, более качественный ретривер
93.0%
Oracle Evidence (Прямой ввод)
Если нужные документы сразу положить в контекст
График влияния качества ретривера на точность ответов
Нажмите для увеличения
📺 В видео [06:47]: Эксперимент с Oracle Evidence. Если искусственно скормить модели документы-улики, точность достигает 93% даже на GPT-4. Бутылочное горлышко — именно поиск доказательств в корпусе!
⏱️ 06:47
Эволюция поведения

Человек против AI-агента: смена поисковой нагрузки

Анализ логов запросов: почему интуиция классического веб-поиска больше не работает.

В 2006 году AOL случайно опубликовала анонимизированные логи поисковых запросов пользователей. Они показали, что медианный человек ищет всего 2 словами («home depot», «weather forecast»). Современные логи людей показывают ровно ту же картину.

AI-агент ведет себя принципиально иначе: его медиана — 10 терминов, а средняя длина самого первого запроса в траектории составляет 19 терминов!

Слайд: GPT-5 issues power-user queries
Нажмите для увеличения
📺 В видео [08:37]: Сравнение распределения запросов. Агент сразу использует поисковый синтаксис опытного пользователя: фильтр домена, год, сущности и точные совпадения фраз в кавычках.
⏱️ 08:37
ЧЕЛОВЕК (AOL / WEB)

2 слова в среднем

Ленивый ввод, минимум конкретики. Ожидание, что поисковик сам «догадается» по кликам и популярности. Человек просматривает первые 3–5 ссылок и редко переформулирует запрос более 1–2 раз.

home depot
AI-АГЕНТ (GPT-5 / HORNET)

10–19 слов + операторы

Сверхдетальный запрос: модель извлекает из параметрической памяти имена участников, года событий, названия турниров и специфические ключевые слова, помещая критичные фразы в кавычки.

site:snooker.org 2021 UK Championship final Zhao Xintong Brecel "frame" "scores"
Тюнинг гиперпараметров

Which BM25 Do You Mean? — цена одной настройки (+18%)

Как дефолтные параметры тридцатилетней давности искажали академические бенчмарки.

В классической формуле BM25 есть два ключевых параметра: k1 (насыщение частоты терминов) и b (штраф за длину документа). Исторически в библиотеках типа Lucene закрепились параметры k1=0.9, b=0.4 (или k1=1.2, b=0.75), рассчитанные на короткие новостные тексты и запросы из 2 слов.

Исследователи из Pi-Serini (arXiv:2605.10848) проверили, что будет, если настроить BM25 под длинные документы веб-поиска (k1=25, b=1).

График Which BM25: 64% vs 82%
Нажмите для увеличения
📺 В видео [09:50]: Настройка параметров BM25 подняла точность ответов агента с 64.0% до 82.0% (+18 пунктов), а recall доказательств — с 84.6% до 95.7%!
⏱️ 09:50
EXACT

Точные совпадения

Агент знает специфические имена, SKU товаров, артикулы, почтовые индексы и даты. Эмбеддинг-модели размывают эти токены в плотные векторы фиксированного словаря, а BM25 находит их со 100% точностью.

CHEAP

В разы дешевле нейросетей

Современные embedding-модели для dense-retrieval достигают 7B–8B параметров. Их инференс на миллиардах страниц требует огромных кластеров GPU. BM25 работает на стандартных CPU за доли миллисекунды.

EXPLAINABLE

Понятно для самой LLM

Когда агент получает результат BM25, он точно видит, какие слова совпали, а какие нет. Это позволяет модели легко скорректировать запрос в следующей итерации (добавить кавычки, убрать лишнее слово).

Архитектура SERP будущего

«BM25 + grep Is All You Need» — исследование Waterloo

Почему виртуальная файловая система и bash-утилиты оказались эффективнее кастомных RAG-инструментов.

Группа исследователей Джимми Линя (Jimmy Lin) из Университета Ватерлоо опубликовала фундаментальную работу DR-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion (arXiv:2606.14885).

Вместо того чтобы заставлять модель парсить JSON-выдачу поисковика, отобранные документы монтируются в локальную виртуальную файловую систему (VFS / workspace). Затем агент исследует их стандартными Unix-утилитами: ripgrep, cat, head, sed.

Веб-корпус Billions документов Слишком велик для контекста или прямого сканирования shell BM25 VFS Workspace Candidates отобраны в песочницу • doc_0182.txt • doc_0491.txt • doc_1204.txt • doc_8821.txt bash Shell Primitives rg + read точечная навигация $ rg -i "founder" . $ sed -n '12,30p' $ head -n 40 $ wc -l *.txt Точность 73.3% DR-DCI + reset vs 45% у базового Qwen3 retrieval agent
Архитектура DR-DCI: объединение BM25 для грубого отсева с Unix-утилитами для точного чтения. ⏱️ 12:06
Слайд: BM25 + grep Is All You Need
Нажмите для увеличения
📺 В видео [12:06]: Все передовые LLM обучаются на программировании, работе в терминале и bash. Связка VFS + grep идеально ложится на природные сильные стороны моделей!
⏱️ 12:06
Метрики и производительность

Классическая оценка мертва: траектории и бенчмарк на 100M страниц

Почему nDCG@10 больше ничего не значит и как Hornet масштабирует BM25 на одном сервере.

УСТАРЕЛО // STATIC IR

Оценка разового запроса (nDCG)

В классическом поиске оценивался один список из 10 ссылок на один запрос человека. Если на первой позиции не было идеального документа — система получала штраф. Но агент делает десятки запросов, переформулируя их на лету!

СОВРЕМЕННО // AGENTIC IR

Оценка траектории решения задачи

Оценивается система целиком (Агент + Ретривер): достигнут ли финальный правильный ответ (Success Rate), сколько шагов потребовалось, какова общая задержка сессии, объем потребленных токенов и суммарная стоимость.

Бенчмарк масштабируемости Hornet: 100M документов
Нажмите для увеличения
📺 В видео [15:35]: Тестирование на 100M веб-документов (top-100 retrieval). Hornet держит задержку в десятки миллисекунд вплоть до 2100+ QPS на одном узле, тогда как альтернативные движки A, B, C уходят в секундные задержки уже при 500 QPS.
⏱️ 15:35
Навигация по докладу

Хронологический таймлайн со скриншотами

Кликайте по времени для перехода к моменту на YouTube или по миниатюрам для зума слайдов.

  1. Вступление: 30-летний алгоритм возвращается

    Ю Кристьян Бергум (CEO Hornet.dev) начинает доклад с параллели: пока Норвегия играет на чемпионате мира, в мире AI возвращается классическая функция ранжирования 1990-х годов.

  2. Что такое агентный поиск (Agentic Search)

    Определение поиска внутри цикла агента. Три столпа инфраструктуры: способная модель (LLM), обвязка инструментов (Harness / Code mode) и быстрый ретривер кандидатов.

  3. Откуда взялось название Best Match 25

    История алгоритма: исследователи команды Окапи проводили серию экспериментов, и 25-я конфигурация оказалась самой эффективной. 40 лет оптимизаций ускорения Top-K (WAND, Block-Max).

  4. Формула не изменилась — изменился пользователь

    BM25 всегда был просто «бейзлайном, который все пытались победить нейросетями». Но LLM обладает огромным запасом параметрических знаний и пользуется этим инструментом иначе.

  5. Бенчмарк BrowseComp-Plus: 830 загадок

    830 сложных вопросов с эталонными ответами и корпус из 100 195 веб-страниц. Протокол тестирования модели в агентном цикле поиска с тулом search(query).

    Превью BrowseComp-Plus
  6. Контекстные окна — это дискеты на 1.44 МБ

    Контекст до наступления context rot (~350k токенов) равен 1.4 МБ текста. Это лишь 0.05% от корпуса BrowseComp-Plus (736M токенов). Без ретривера агент слеп.

    Превью Floppy Disk
  7. Reasoning — не проблема: Oracle дает 93%

    Если улики сразу лежат в контексте, модель решает 93% сложнейших задач. Но при поиске через ретривер точность падает до 55–70%. Узкое место системы — именно ретривер.

    Превью Retrieval quality
  8. Один вопрос превращается в поисковую сессию

    Траектория агента: широкий разведочный запрос → чтение первых результатов → сужение по найденным сущностям → верификация дат и деталей.

  9. GPT-5 формулирует профессиональные запросы

    Сравнение с логами AOL: человек ищет 2 словами, агент выдает медиану в 10 слов, а первый запрос формулирует в среднем на 19 слов со сложными операторами.

    Превью Power user queries
  10. Which BM25 Do You Mean? Прыжок на +18%

    Исследование Pi-Serini: смена дефолтных гиперпараметров Lucene на оптимизированные под длинный веб-текст поднимает accuracy с 64% до 82%.

    Превью Which BM25
  11. BM25 + grep Is All You Need (исследование Waterloo)

    SERP нового поколения: BM25 выгружает кандидатов в виртуальную файловую систему (VFS), а агент исследует их через ripgrep и sed, достигая 73.3%.

    Превью BM25 + grep
  12. Смерть классической оценки (nDCG@10)

    Оценивать нужно не ранжирование одного запроса, а всю сквозную траекторию работы агента: процент успеха, стоимость, задержку и число шагов.

  13. Бенчмарк Hornet на 100M веб-документов

    График масштабирования: Hornet держит задержку в 50–100 мс при нагрузке свыше 2000 QPS на одной машине, опережая традиционные поисковые движки в разы.

    Превью бенчмарка Hornet
  14. Четыре главных вывода доклада

    Резюме выступления: новый пользователь, важность конфигурации BM25, преимущества интерпретируемости и мощь связки BM25 + grep.

Прямая речь

Цитаты Ю Кристьяна Бергума

Яркие формулировки из доклада о природе поиска, моделях и инфраструктуре.

«BM25 не стал внезапно магическим. Изменился пользователь. Модели обладают огромным параметрическим знанием — они знают сущности, компании, даты, почтовые индексы и артикулы. Поэтому они формируют запросы, которые ни один человек никогда бы не напечатал».
«Я люблю сравнивать контекстные окна с дискетами 1.44 МБ из 80-х. Практическое окно современных моделей до наступления деградации — около 350 000 токенов. Даже когда мы получим AGI, мы все равно будем ограничены этим окном. И что-то должно решать, что именно попадет на эту дискету».
«В традиционном поиске мы привыкли оценивать один запрос, один ранжированный список и считать nDCG. Все это теперь мертво. Новый пользователь — это агент, который переформулирует запросы, делает экспансию и идет по траектории».
«Все frontier-лаборатории оптимизируют свои модели под программирование, bash и вызов инструментов. Если вы строите свой поиск в русле того, в чем модели становятся лучше с каждым релизом — вы выигрываете автоматически».
Чек-лист для инженеров

Что внедрить в свою поисковую систему и агентный RAG

Практические шаги по оптимизации поиска для автономных агентов на основе доклада.

Материалы и первоисточники

Упомянутые исследования и ресурсы

Научные статьи и ссылки, на которые опирался спикер в докладе.

ACL 2026

BrowseComp-Plus

Бенчмарк глубоких веб-исследований для автономных агентов. 830 сложных многошаговых вопросов на корпусе из 100k документов.

arXiv:2508.06600 ↗

WATERLOO 2026

DR-DCI: Dynamic Workspace

Исследование группы Jimmy Lin: масштабирование прямого взаимодействия с корпусом через VFS и утилиты ripgrep/bash.

arXiv:2606.14885 ↗

PI-SERINI

Tuning BM25 for Agents

Анализ влияния параметров BM25 на качество агентного поиска: рост точности с 64% до 82% на длинных документах.

arXiv:2605.10848 ↗

Скриншот слайда

Слайд презентации в высоком разрешении