3Xray
汇集主流 AI 大模型的基准测试成绩、运行成本与任务表现,帮助你更直观地比较不同模型的能力差异。
数据更新于 2026-08-18 10:30
排行榜
按模型自定义选择
Anthropic
OpenAI
Google
DeepSeek
xAI
月之暗面
通义千问
智谱
Muse
推理能力 × 平均运行成本
共 24 个模型
排名模型
能力得分平均成本
平均输出量平均步数
1
claude-opus-5
[max]
74%
±4%
能力得分 74%
平均成本 $11.84
平均输出量 118k
平均步数 99
2
gpt-5-6-sol
[max]
73%
±3%
能力得分 73%
平均成本 $8.39
平均输出量 60k
平均步数 61
3
claude-fable-5
[xhigh]
70%
±3%
能力得分 70%
平均成本 $13.41
平均输出量 80k
平均步数 68
4
gpt-5-6-terra
[max]
70%
±3%
能力得分 70%
平均成本 $4.95
平均输出量 72k
平均步数 76
5
kimi-k3
[max]
69%
±5%
能力得分 69%
平均成本 $4.65
平均输出量 81k
平均步数 98
6
grok-4-6
[medium]
67%
±2%
能力得分 67%
平均成本 $3.45
平均输出量 50k
平均步数 70
7
gpt-5-6-luna
[max]
67%
±4%
能力得分 67%
平均成本 $3.03
平均输出量 73k
平均步数 102
8
gpt-5-5
[xhigh]
67%
±6%
能力得分 67%
平均成本 $7.23
平均输出量 46k
平均步数 82
9
gemini-3-7-flash
[medium]
65%
±3%
能力得分 65%
平均成本 $2.03
平均输出量 94k
平均步数 117
10
deepseek-v4-pro
[max]
63%
±6%
能力得分 63%
平均成本 $0.24
平均输出量 106k
平均步数 155
11
claude-opus-4-8
[max]
59%
±2%
能力得分 59%
平均成本 $13.22
平均输出量 135k
平均步数 120
12
qwen3-8-max
[xhigh]
57%
±3%
能力得分 57%
平均成本 $3.73
平均输出量 95k
平均步数 111
13
muse-spark-1-2
[xhigh]
55%
±2%
能力得分 55%
平均成本 $3.70
平均输出量 99k
平均步数 101
14
claude-sonnet-5
[max]
54%
±4%
能力得分 54%
平均成本 $26.40
平均输出量 214k
平均步数 268
15
grok-4-5
[high]
54%
±2%
能力得分 54%
平均成本 $2.42
平均输出量 36k
平均步数 61
16
muse-spark-1-1
[xhigh]
53%
±3%
能力得分 53%
平均成本 $2.36
平均输出量 74k
平均步数 96
17
deepseek-v4-flash
[max]
53%
±4%
能力得分 53%
平均成本 $0.10
平均输出量 108k
平均步数 153
18
gpt-5-4
[xhigh]
52%
±2%
能力得分 52%
平均成本 $5.65
平均输出量 71k
平均步数 70
19
gemini-3-6-flash
[high]
47%
±4%
能力得分 47%
平均成本 $4.42
平均输出量 96k
平均步数 117
20
glm-5-2
[max]
44%
±2%
能力得分 44%
平均成本 $3.92
平均输出量 78k
平均步数 129
21
gemini-3-5-flash
[high]
36%
±4%
能力得分 36%
平均成本 $3.45
平均输出量 76k
平均步数 105
22
kimi-k2-7-code
31%
±1%
能力得分 31%
平均成本 $2.82
平均输出量 59k
平均步数 149
23
claude-sonnet-4-6
[high]
30%
±4%
能力得分 30%
平均成本 $5.52
平均输出量 76k
平均步数 134
24
gemini-3-1-pro-preview
[high]
12%
±1%
能力得分 12%
平均成本 $2.14
平均输出量 28k
平均步数 76
说明
当今领先的公开编码基准测试已开始趋于饱和:顶级模型集中在一个狭窄的分数区间内,相邻配置的置信区间经常重叠。
3Xray 是一款旨在打破这种局面的长期软件工程基准测试。它相比现有的公开基准测试,实现了以下四项改进:
- 无污染:任务是从头开始编写的,而不是从现有的提交或 PR 中改编的,因此任何模型在预训练期间都没有见过解决方案。
- 高度多样性:任务涵盖 5 种语言的 91 个存储库的广泛范围。
- 实际复杂性:提示的长度约为 SWE-bench Pro 的一半,但解决方案需要 5.5 倍的代码量和约 2 倍的输出标记。
- 可靠的验证:验证器是手工编写的,用于测试软件行为,而不是实现细节。
最终得到的基准反映了当今前沿编码代理在软件工程工作中的实际表现。
页面数据更新时间:2026-08-18 10:30