← Все статьи

🧑‍💻 OpenRouter провели сравнительное тестирование LLM в агентской среде

07.08.2026
🧑‍💻 OpenRouter провели сравнительное тестирование LLM в агентской среде

Платформа OpenRouter организовала эксперимент: одиннадцать языковых моделей сошлись в двумерном баттл-рояле. Тридцать матчей, автономные агенты, никаких предопределённых стратегий — только способность модели принимать решения в реальном времени.


Ключевые результаты:

🥇 Grok 4.1 Fast продемонстрировал наивысший процент побед — 43%

🤝 Claude Sonnet 4.6 выбрал стратегию дипломатии и координации с другими агентами. Несмотря на высокие reasoning-способности, данный подход не принёс победы

💰 Экономическая эффективность: самая дешёвая модель превзошла самую дорогую по показателю cost-per-win в двадцать семь раз

☕️ Практический вывод:


❗️ Результаты эксперимента подтверждают: способность модели к рассуждению (reasoning), измеряемая стандартными бенчмарками, не коррелирует напрямую с эффективностью в агентских сценариях. Для построения автономных пайплайнов критичны поведенческие характеристики модели в среде, а не позиция в лидербордах.


Данное исследование знаменует переход к новому типу оценки LLM — от статических тестов к динамическим многоагентным средам.

🔗 Полный отчёт OpenRouter

✈️ Telegram 🔵 ВКонтакте