ai-assistants
Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2
Всем привет! В прошлой статье я гонял Алису и Гигачат как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должнв была отвечать текстом в браузере - как будто она общалас с пользователем, пользователь задавал разные задания и тесты определяли, справляется ли модель. Тут - уже совсем другой экзамен. Агенту дают настоящий компьютер и настоящее задание: починить пайплайн, разобраться с проблемами в консоли сервера, собрать форму, закрыть визу, свести таблицу из почты и банка. На выходе ждут рабочий артефакт. Terminal-Bench 4 и OSWorld 2 - это два теста, которые различные лаборатории сейчас считают маст хэв. Как вы наверное заметили, мне интересно тестировать наши, отечественные модели, отечественные решения. Почему? Ну потому что в первую очередь я верю в мозги наших разработчиков, которые во всем мире всегда считались топовыми.
Читать далее →