Маракуйя ИИ проходит Terminal-Bench 4 и OSWorld 2: новый бенчмарк агентных моделей
Оригинал: Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2
Конспект редакции
Автор протестировал Маракуйя ИИ на агентных бенчмарках Terminal-Bench 4 и OSWorld 2 — это продолжение серии сравнений российских LLM в реальных задачах.
Автор продолжает серию сравнительных тестов российских языковых моделей, но меняет методологию: если в прошлый раз Алиса и Гигачат оценивались как чат-ассистенты в браузере, то теперь акцент сделан на агентных бенчмарках Terminal-Bench 4 и OSWorld 2. Эти наборы проверяют способность модели выполнять многошаговые задачи в терминале и в среде операционной системы, а не просто генерировать текст.
Такой переход отражает общий сдвиг индустрии от оценки «разговорных» качеств к измерению практической автономности агентов. Для киноиндустрии это релевантно в той мере, в какой продакшн- и постпродакшн-пайплайны всё чаще автоматизируются с помощью ИИ-агентов.
В анонсе не раскрыты конкретные результаты и методика подсчёта — детали, включая цифры и выводы по каждой модели, доступны в полной версии статьи на Хабре.
Материал агрегирован; полный текст — на сайте Хабр — ИТ-новости.
Почему это важно
Агентные бенчмарки становятся новым стандартом оценки ИИ-моделей, и их результаты напрямую влияют на выбор инструментов в продакшене, включая кино- и медиапайплайны.
Контекст
В предыдущей статье автор сравнивал Алису и Гигачат на чат-ориентированных бенчмарках (Arena-Hard, WildBench и др.). Теперь фокус смещён на агентные сценарии.
Влияние на индустрию
Для киноиндустрии такие тесты важны: агентные ИИ всё чаще применяются в монтаже, VFX-пайплайнах и автоматизации постпродакшна.
Что дальше
Фото (8)
Увеличить1 / 8Упоминается
Комментарий редактора Игоря
Тема на стыке ИИ и медиапроизводства — недооценённая, но через год-два такие бенчмарки будут в каждом продакшн-отчёте.





