Категория «Агенты» оценивает способность языковых моделей самостоятельно выполнять сложные задачи, а не просто отвечать на отдельные текстовые запросы. Агентные бенчмарки проверяют, насколько хорошо модель справляется с декомпозицией сложных целей, использованием внешних инструментов и API, выполнением команд в терминальной среде, анализом результатов работы инструментов и корректировкой своих действий после возникновения ошибок.

Итоговый балл формируется на основе результатов агентских бенчмарков и рейтингов. Рейтинг показывает, какие модели лучше всего справляются со сложными многоэтапными задачами, требующими самостоятельного планирования и использования внешних инструментов.

Ищете универсальную модель для разных сценариев? Агентные возможности составляют 20% итоговой оценки. Перейдите в общий рейтинг моделей ИИ, чтобы увидеть, как ведущие модели в этой категории справляются также с программированием, математикой и сложными задачами на рассуждение.

Последнее обновление: 9 октября 2026 г.
Место Название Модели Относительное качество Балл
1 Claude Opus 5.5
Качество агентов 97,74%

97,74
2 GPT-6 Astra
Качество агентов 90,21%

90,21
3 Claude Fable 5.1
Качество агентов 89,71%

89,71
4 Gemini 4 Argon
Качество агентов 87,36%

87,36
5 Ling 3.1 Flash
Качество агентов 87,26%

87,26
6 GPT-6.1 Sol
Качество агентов 84,00%

84,00
7 Claude Fable 5
Качество агентов 83,95%

83,95
8 Claude Opus 5
Качество агентов 83,91%

83,91
9 DeepSeek-V4.1-Flash
Качество агентов 83,90%

83,90
10 Claude Sonnet 5.5
Качество агентов 80,26%

80,26
11 DeepSeek-V4-Flash
Качество агентов 79,37%

79,37
12 GPT-6 Sol
Качество агентов 79,29%

79,29
13 GPT-5.6 Sol
Качество агентов 78,50%

78,50
14 Muse Spark 1.3
Качество агентов 78,41%

78,41
15 Kimi K3
Качество агентов 76,95%

76,95
16 Qwen3.8
Качество агентов 75,55%

75,55
17 Seed 2.1 Pro
Качество агентов 74,87%

74,87
18 GLM-5.3
Качество агентов 74,42%

74,42
19 MiMo-V2.6-Pro
Качество агентов 74,42%

74,42
20 Claude Opus 4.8
Качество агентов 74,22%

74,22
21 Claude Sonnet 5
Качество агентов 73,08%

73,08
22 Hy4
Качество агентов 73,07%

73,07
23 Claude Haiku 5.5
Качество агентов 72,78%

72,78
24 GPT-5.5
Качество агентов 70,97%

70,97
25 Grok 4.7
Качество агентов 70,92%

70,92
26 Ling 3.0 Flash Fin
Качество агентов 70,51%

70,51
27 Gemini 3.8 Flash
Качество агентов 70,03%

70,03
28 DeepSeek-V4-Pro
Качество агентов 69,99%

69,99
29 Grok 4.6
Качество агентов 69,94%

69,94
30 GPT-5.6 Terra
Качество агентов 69,76%

69,76
31 Claude Opus 4.7
Качество агентов 69,44%

69,44
32 Qwen3.8-Flash-Next
Качество агентов 69,03%

69,03
33 GLM-5.3-Flash
Качество агентов 67,82%

67,82
34 GLM-5.2
Качество агентов 67,24%

67,24
35 Gemini 3.5 Flash
Качество агентов 66,86%

66,86
36 Grok 4.5
Качество агентов 66,75%

66,75
37 GPT-6 Luna
Качество агентов 66,42%

66,42
38 Claude Opus 4.6
Качество агентов 65,73%

65,73
39 Qwen3.8-27B
Качество агентов 65,44%

65,44
40 MiMo-V2.6-Flash
Качество агентов 65,25%

65,25
41 Gemini 3.7 Flash
Качество агентов 64,35%

64,35
42 GPT-5.4
Качество агентов 64,18%

64,18
43 Kimi K2.6
Качество агентов 63,67%

63,67
44 Muse Spark 1.1
Качество агентов 62,54%

62,54
45 Kimi K2.7 Code
Качество агентов 62,37%

62,37
46 GLM-5.1
Качество агентов 61,95%

61,95
47 GPT-5.6 Luna
Качество агентов 61,09%

61,09
48 Mistral Large 4
Качество агентов 60,86%

60,86
49 GPT-5.3 Codex
Качество агентов 59,86%

59,86
50 Grok Build 0.1
Качество агентов 59,25%

59,25
51 Muse Spark 1.2
Качество агентов 59,10%

59,10
52 GPT-5.2 Codex
Качество агентов 58,74%

58,74
53 Claude Sonnet 4.6
Качество агентов 58,53%

58,53
54 MiMo-V2.5
Качество агентов 57,24%

57,24
55 GPT-5.2
Качество агентов 55,57%

55,57
56 Qwen3.5-397B-A17B
Качество агентов 55,32%

55,32
57 Qwen3.6 Plus
Качество агентов 54,79%

54,79
58 GLM-5
Качество агентов 54,62%

54,62
59 Step 5
Качество агентов 54,26%

54,26
60 Ling 3.0 Flash
Качество агентов 53,93%

53,93
61 GPT-5.4 mini
Качество агентов 53,76%

53,76
62 GLM-5V-Turbo
Качество агентов 53,75%

53,75
63 Qwen3.7
Качество агентов 53,41%

53,41
64 Gemini 3.5 Flash-Lite
Качество агентов 52,69%

52,69
65 MiniMax M2.1
Качество агентов 52,01%

52,01
66 Kimi K2.5
Качество агентов 51,83%

51,83
67 Claude Opus 4.5
Качество агентов 51,25%

51,25
68 Gemini 3 Flash
Качество агентов 51,13%

51,13
69 Hy3
Качество агентов 51,07%

51,07
70 Claude Sonnet 4.5
Качество агентов 50,61%

50,61
71 MiniMax M2.5
Качество агентов 50,44%

50,44
72 Seed 2.0 Pro
Качество агентов 50,26%

50,26
73 MiMo-V2-Pro
Качество агентов 50,26%

50,26
74 GPT-5.4 nano
Качество агентов 49,99%

49,99
75 Qwen3.6-27B
Качество агентов 49,59%

49,59
76 Gemini 3.6 Flash
Качество агентов 49,39%

49,39
77 MiniMax M3
Качество агентов 48,81%

48,81
78 Kimi K2
Качество агентов 48,69%

48,69
79 Gemini 3.1 Pro
Качество агентов 48,31%

48,31
80 MiniMax M2.7
Качество агентов 47,82%

47,82
81 Step-3.5-Flash
Качество агентов 47,47%

47,47
82 Qwen3.5-122B-A10B
Качество агентов 47,47%

47,47
83 Gemini 3 Pro
Качество агентов 47,29%

47,29
84 Qwen3.5-27B
Качество агентов 45,90%

45,90
85 Qwen3.7-Plus
Качество агентов 45,34%

45,34
86 Muse Spark
Качество агентов 45,20%

45,20
87 Gemma 4 31B
Качество агентов 44,33%

44,33
88 MiMo-V2.5-Pro
Качество агентов 44,19%

44,19
89 Claude Haiku 4.5
Качество агентов 43,98%

43,98
90 Inkling
Качество агентов 43,70%

43,70
91 Qwen3 VL 235B A22B
Качество агентов 43,46%

43,46
92 LongCat-Flash
Качество агентов 43,46%

43,46
93 Claude Opus 4.1
Качество агентов 43,46%

43,46
94 Step 3.7 Flash
Качество агентов 43,46%

43,46
95 Qwen3 VL 32B
Качество агентов 43,11%

43,11
96 Gemma 4 26B-A4B
Качество агентов 42,76%

42,76
97 Qwen3.5-35B-A3B
Качество агентов 42,23%

42,23
98 Qwen3-Next-80B-A3B
Качество агентов 42,06%

42,06
99 DeepSeek-V3.2
Качество агентов 41,71%

41,71
100 Qwen3.6-35B-A3B
Качество агентов 41,01%

41,01