3Xray

汇集主流 AI 大模型的基准测试成绩、运行成本与任务表现,帮助你更直观地比较不同模型的能力差异。

了解测试方法与数据说明 →

数据更新于 2026-08-18 10:30

排行榜

24 个模型 · 113 个任务 · 更新于 2026-08-18 10:30
按模型自定义选择
Anthropic
OpenAI
Google
DeepSeek
xAI
月之暗面
通义千问
智谱
Muse

推理能力 × 平均运行成本

共 24 个模型
排名模型能力得分 能力得分平均成本 平均输出量平均步数
1 claude-opus-5 [max] 74% ±4%
能力得分 74% 平均成本 $11.84 平均输出量 118k 平均步数 99
2 gpt-5-6-sol [max] 73% ±3%
能力得分 73% 平均成本 $8.39 平均输出量 60k 平均步数 61
3 claude-fable-5 [xhigh] 70% ±3%
能力得分 70% 平均成本 $13.41 平均输出量 80k 平均步数 68
4 gpt-5-6-terra [max] 70% ±3%
能力得分 70% 平均成本 $4.95 平均输出量 72k 平均步数 76
5 kimi-k3 [max] 69% ±5%
能力得分 69% 平均成本 $4.65 平均输出量 81k 平均步数 98
6 grok-4-6 [medium] 67% ±2%
能力得分 67% 平均成本 $3.45 平均输出量 50k 平均步数 70
7 gpt-5-6-luna [max] 67% ±4%
能力得分 67% 平均成本 $3.03 平均输出量 73k 平均步数 102
8 gpt-5-5 [xhigh] 67% ±6%
能力得分 67% 平均成本 $7.23 平均输出量 46k 平均步数 82
9 gemini-3-7-flash [medium] 65% ±3%
能力得分 65% 平均成本 $2.03 平均输出量 94k 平均步数 117
10 deepseek-v4-pro [max] 63% ±6%
能力得分 63% 平均成本 $0.24 平均输出量 106k 平均步数 155
11 claude-opus-4-8 [max] 59% ±2%
能力得分 59% 平均成本 $13.22 平均输出量 135k 平均步数 120
12 qwen3-8-max [xhigh] 57% ±3%
能力得分 57% 平均成本 $3.73 平均输出量 95k 平均步数 111
13 muse-spark-1-2 [xhigh] 55% ±2%
能力得分 55% 平均成本 $3.70 平均输出量 99k 平均步数 101
14 claude-sonnet-5 [max] 54% ±4%
能力得分 54% 平均成本 $26.40 平均输出量 214k 平均步数 268
15 grok-4-5 [high] 54% ±2%
能力得分 54% 平均成本 $2.42 平均输出量 36k 平均步数 61
16 muse-spark-1-1 [xhigh] 53% ±3%
能力得分 53% 平均成本 $2.36 平均输出量 74k 平均步数 96
17 deepseek-v4-flash [max] 53% ±4%
能力得分 53% 平均成本 $0.10 平均输出量 108k 平均步数 153
18 gpt-5-4 [xhigh] 52% ±2%
能力得分 52% 平均成本 $5.65 平均输出量 71k 平均步数 70
19 gemini-3-6-flash [high] 47% ±4%
能力得分 47% 平均成本 $4.42 平均输出量 96k 平均步数 117
20 glm-5-2 [max] 44% ±2%
能力得分 44% 平均成本 $3.92 平均输出量 78k 平均步数 129
21 gemini-3-5-flash [high] 36% ±4%
能力得分 36% 平均成本 $3.45 平均输出量 76k 平均步数 105
22 kimi-k2-7-code 31% ±1%
能力得分 31% 平均成本 $2.82 平均输出量 59k 平均步数 149
23 claude-sonnet-4-6 [high] 30% ±4%
能力得分 30% 平均成本 $5.52 平均输出量 76k 平均步数 134
24 gemini-3-1-pro-preview [high] 12% ±1%
能力得分 12% 平均成本 $2.14 平均输出量 28k 平均步数 76

说明

当今领先的公开编码基准测试已开始趋于饱和:顶级模型集中在一个狭窄的分数区间内,相邻配置的置信区间经常重叠。

3Xray 是一款旨在打破这种局面的长期软件工程基准测试。它相比现有的公开基准测试,实现了以下四项改进:

  • 无污染:任务是从头开始编写的,而不是从现有的提交或 PR 中改编的,因此任何模型在预训练期间都没有见过解决方案。
  • 高度多样性:任务涵盖 5 种语言的 91 个存储库的广泛范围。
  • 实际复杂性:提示的长度约为 SWE-bench Pro 的一半,但解决方案需要 5.5 倍的代码量和约 2 倍的输出标记。
  • 可靠的验证:验证器是手工编写的,用于测试软件行为,而不是实现细节。

最终得到的基准反映了当今前沿编码代理在软件工程工作中的实际表现。

页面数据更新时间:2026-08-18 10:30