artyom.space
artyom.space
// СИГНАЛ ИЗ 34.7°N · 33.0°E
телега тг-канал инста линкедин

Нам нужен ревизор. Для агентов.

ЗАМЕТКА · 2 МИН · 2026-10-06

Я пригласил вас, господа, с тем, чтобы сообщить вам пренеприятное известие: нам нужен ревизор.

Для агентов.

Мы сейчас в Unreal Labs гоняем разные бенчмарки. Я погружаюсь в них все больше, и все больше их текущее состояние мне кажется каким-то стремным.

Бенчмарки нужны, чтобы понять: этот агент или модель лучше или хуже других? Насколько? Часто для этого собираем набор синтетических коротких задачек с однозначным результатом, смотрим процент выполнения у каждого кандидата, ранжируем. Вуаля - вот табличка и график.

Мем с нормальным распределением: слева и справа «оцениваю по вайбам», в середине - множество бенчмарков для моделей и агентов.

Математическая олимпиада для агентов завершена, а теперь лучший олимпиадник отправляется в мир решать реальные задачи. И, вот это сюрприз, олимпиадники не всегда хорошо справляются с задачами реального мира 🤡

Результаты на коротких задачах мы научились как-то замерять. Но если задача растягивается на часы или дни, с пачками промежуточных решений, хождением по разным системам, ошибками в процессе и исправлениями по ходу, то с такими замерами ситуация сильно хуже.

Это похоже на написание автотестов, только для всей компании. Далеко не во всех сферах бизнеса процессы достаточно формализованы, чтобы можно было задавать критерии приемки на промежуточных этапах - только KPI на результат и выручку, только хардкор.

Нельзя управлять тем, что ты не можешь измерить. А с агентами хочется еще добавить: удачи придумать, как это все измерять, хехе 😏

По-моему, нужны три штуки, чтобы это все завелось:

  • Экспертные задания.
  • Качественная проверка.
  • Доверие к аудитору.

Слабые задания дадут красивый балл за бесполезную работу. Слабая проверка пропустит херню. А без доверия зачем это все вообще?

Возможно, поэтому агенты настолько хороши в кодинге - во фронтир-лабах идет регулярный догфудинг, быстрый фидбек внутри, пила точит сама себя.

Еще важное - бенчмарки должны устаревать. Если все модели почти идеально проходят тест и он перестает их различать, пора его менять. Vals, например, так заменил CorpFin на Excel Modelling Benchmark. Вопросы на олимпиадах тоже меняют каждый год.

Нужны критерии устаревания.

Хочется верить, что когда-нибудь я смогу открыть одну мега-табличку, выбрать свою сферу и тип задач, а там будет видно, какому агенту их можно отдать, сколько это стоит и сколько раз придется вмешаться.

Но сначала нам самим надо научиться описывать и проверять работу, которую мы делаем. И сколько важного в ней останется за пределами этой таблички?

Есть и другие посты