Категория «Агенты» оценивает способность языковых моделей самостоятельно выполнять сложные задачи, а не просто отвечать на отдельные текстовые запросы. Агентные бенчмарки проверяют, насколько хорошо модель справляется с декомпозицией сложных целей, использованием внешних инструментов и API, выполнением команд в терминальной среде, анализом результатов работы инструментов и корректировкой своих действий после возникновения ошибок.
Итоговый балл формируется на основе результатов агентских бенчмарков и рейтингов. Рейтинг показывает, какие модели лучше всего справляются со сложными многоэтапными задачами, требующими самостоятельного планирования и использования внешних инструментов.
Ищете универсальную модель для разных сценариев? Агентные возможности составляют 20% итоговой оценки. Перейдите в общий рейтинг моделей ИИ, чтобы увидеть, как ведущие модели в этой категории справляются также с программированием, математикой и сложными задачами на рассуждение.
| Место | Название Модели | Относительное качество | Балл |
|---|---|---|---|
| 1 | Claude Opus 5.5 |
|
97,74 |
| 2 | GPT-6 Astra |
|
90,21 |
| 3 | Claude Fable 5.1 |
|
89,71 |
| 4 | Gemini 4 Argon |
|
87,36 |
| 5 | Ling 3.1 Flash |
|
87,26 |
| 6 | GPT-6.1 Sol |
|
84,00 |
| 7 | Claude Fable 5 |
|
83,95 |
| 8 | Claude Opus 5 |
|
83,91 |
| 9 | DeepSeek-V4.1-Flash |
|
83,90 |
| 10 | Claude Sonnet 5.5 |
|
80,26 |
| 11 | DeepSeek-V4-Flash |
|
79,37 |
| 12 | GPT-6 Sol |
|
79,29 |
| 13 | GPT-5.6 Sol |
|
78,50 |
| 14 | Muse Spark 1.3 |
|
78,41 |
| 15 | Kimi K3 |
|
76,95 |
| 16 | Qwen3.8 |
|
75,55 |
| 17 | Seed 2.1 Pro |
|
74,87 |
| 18 | GLM-5.3 |
|
74,42 |
| 19 | MiMo-V2.6-Pro |
|
74,42 |
| 20 | Claude Opus 4.8 |
|
74,22 |
| 21 | Claude Sonnet 5 |
|
73,08 |
| 22 | Hy4 |
|
73,07 |
| 23 | Claude Haiku 5.5 |
|
72,78 |
| 24 | GPT-5.5 |
|
70,97 |
| 25 | Grok 4.7 |
|
70,92 |
| 26 | Ling 3.0 Flash Fin |
|
70,51 |
| 27 | Gemini 3.8 Flash |
|
70,03 |
| 28 | DeepSeek-V4-Pro |
|
69,99 |
| 29 | Grok 4.6 |
|
69,94 |
| 30 | GPT-5.6 Terra |
|
69,76 |
| 31 | Claude Opus 4.7 |
|
69,44 |
| 32 | Qwen3.8-Flash-Next |
|
69,03 |
| 33 | GLM-5.3-Flash |
|
67,82 |
| 34 | GLM-5.2 |
|
67,24 |
| 35 | Gemini 3.5 Flash |
|
66,86 |
| 36 | Grok 4.5 |
|
66,75 |
| 37 | GPT-6 Luna |
|
66,42 |
| 38 | Claude Opus 4.6 |
|
65,73 |
| 39 | Qwen3.8-27B |
|
65,44 |
| 40 | MiMo-V2.6-Flash |
|
65,25 |
| 41 | Gemini 3.7 Flash |
|
64,35 |
| 42 | GPT-5.4 |
|
64,18 |
| 43 | Kimi K2.6 |
|
63,67 |
| 44 | Muse Spark 1.1 |
|
62,54 |
| 45 | Kimi K2.7 Code |
|
62,37 |
| 46 | GLM-5.1 |
|
61,95 |
| 47 | GPT-5.6 Luna |
|
61,09 |
| 48 | Mistral Large 4 |
|
60,86 |
| 49 | GPT-5.3 Codex |
|
59,86 |
| 50 | Grok Build 0.1 |
|
59,25 |
| 51 | Muse Spark 1.2 |
|
59,10 |
| 52 | GPT-5.2 Codex |
|
58,74 |
| 53 | Claude Sonnet 4.6 |
|
58,53 |
| 54 | MiMo-V2.5 |
|
57,24 |
| 55 | GPT-5.2 |
|
55,57 |
| 56 | Qwen3.5-397B-A17B |
|
55,32 |
| 57 | Qwen3.6 Plus |
|
54,79 |
| 58 | GLM-5 |
|
54,62 |
| 59 | Step 5 |
|
54,26 |
| 60 | Ling 3.0 Flash |
|
53,93 |
| 61 | GPT-5.4 mini |
|
53,76 |
| 62 | GLM-5V-Turbo |
|
53,75 |
| 63 | Qwen3.7 |
|
53,41 |
| 64 | Gemini 3.5 Flash-Lite |
|
52,69 |
| 65 | MiniMax M2.1 |
|
52,01 |
| 66 | Kimi K2.5 |
|
51,83 |
| 67 | Claude Opus 4.5 |
|
51,25 |
| 68 | Gemini 3 Flash |
|
51,13 |
| 69 | Hy3 |
|
51,07 |
| 70 | Claude Sonnet 4.5 |
|
50,61 |
| 71 | MiniMax M2.5 |
|
50,44 |
| 72 | Seed 2.0 Pro |
|
50,26 |
| 73 | MiMo-V2-Pro |
|
50,26 |
| 74 | GPT-5.4 nano |
|
49,99 |
| 75 | Qwen3.6-27B |
|
49,59 |
| 76 | Gemini 3.6 Flash |
|
49,39 |
| 77 | MiniMax M3 |
|
48,81 |
| 78 | Kimi K2 |
|
48,69 |
| 79 | Gemini 3.1 Pro |
|
48,31 |
| 80 | MiniMax M2.7 |
|
47,82 |
| 81 | Step-3.5-Flash |
|
47,47 |
| 82 | Qwen3.5-122B-A10B |
|
47,47 |
| 83 | Gemini 3 Pro |
|
47,29 |
| 84 | Qwen3.5-27B |
|
45,90 |
| 85 | Qwen3.7-Plus |
|
45,34 |
| 86 | Muse Spark |
|
45,20 |
| 87 | Gemma 4 31B |
|
44,33 |
| 88 | MiMo-V2.5-Pro |
|
44,19 |
| 89 | Claude Haiku 4.5 |
|
43,98 |
| 90 | Inkling |
|
43,70 |
| 91 | Qwen3 VL 235B A22B |
|
43,46 |
| 92 | LongCat-Flash |
|
43,46 |
| 93 | Claude Opus 4.1 |
|
43,46 |
| 94 | Step 3.7 Flash |
|
43,46 |
| 95 | Qwen3 VL 32B |
|
43,11 |
| 96 | Gemma 4 26B-A4B |
|
42,76 |
| 97 | Qwen3.5-35B-A3B |
|
42,23 |
| 98 | Qwen3-Next-80B-A3B |
|
42,06 |
| 99 | DeepSeek-V3.2 |
|
41,71 |
| 100 | Qwen3.6-35B-A3B |
|
41,01 |