🧑💻 OpenRouter провели сравнительное тестирование LLM в агентской среде
Платформа OpenRouter организовала эксперимент: одиннадцать языковых моделей сошлись в двумерном баттл-рояле. Тридцать матчей, автономные агенты, никаких предопределённых стратегий — только способность модели принимать решения в реальном времени.
Ключевые результаты:
🥇 Grok 4.1 Fast продемонстрировал наивысший процент побед — 43%
🤝 Claude Sonnet 4.6 выбрал стратегию дипломатии и координации с другими агентами. Несмотря на высокие reasoning-способности, данный подход не принёс победы
💰 Экономическая эффективность: самая дешёвая модель превзошла самую дорогую по показателю cost-per-win в двадцать семь раз
☕️ Практический вывод:
❗️ Результаты эксперимента подтверждают: способность модели к рассуждению (reasoning), измеряемая стандартными бенчмарками, не коррелирует напрямую с эффективностью в агентских сценариях. Для построения автономных пайплайнов критичны поведенческие характеристики модели в среде, а не позиция в лидербордах.
Данное исследование знаменует переход к новому типу оценки LLM — от статических тестов к динамическим многоагентным средам.