ai-assistants

Бенчмарки Мебиуса: зачем IBM учит ИИ проверять собственные вопросы

Для оценки эффективности ИИ уже давно и успешно используют самые разные бенчмарки. Берем модель/агента, выдаем им одинаковый набор задач, считаем долю успешных решений и получаем удобную цифру, по которой можно сравнивать системы между собой. По результатам используем ту, которая справилась с большим процентом задач. Звучит круто и даже удобно, но, как всегда, есть нюанс: все работает при условии, что сам экзамен составлен правильно. А с этим, как выясняется, бывают проблемы. Внутри бенчмарка могут оказаться некорректные эталонные ответы, противоречивые условия или правила оценки, которые засчитывают правильное решение как ошибку, и еще много всего, что исказит итоговый результат. Летом 2026 года исследователи провели независимый аудит четырех бенчмарков для агентов, работающих с внешними инструментами: BFCL v4, τ²-Bench, LiveMCPBench и MCP-Atlas.

Читать далее →