独立评测快照

真实场景查看评测证据

各来源与指标独立呈现。这些数据用于核验,不构成通用的模型总排名。

最新可用来源结果

快照每日更新。任何来源抓取失败都不会覆盖上一个有效版本。每条结果保留精确模型版本、测试口径和原始排行榜链接。

抓取时间: 2026年7月19日 20:44

Arena · code

查看原始排行榜

Arena 没有官方公开 API。数据来自每日结构化镜像,并始终链接回官方排行榜。

排名精确模型版本成绩指标样本 / 投票
1 kimi-k3 1679 Elo (Elo) 1757
2 claude-fable-5 1631 Elo (Elo) 2505
3 gpt-5.6-sol-xhigh (codex-harness) 1618 Elo (Elo) 2542
4 glm-5.2 (max) 1587 Elo (Elo) 4722
5 claude-opus-4-8-thinking 1562 Elo (Elo) 7309
6 grok-4.5 1558 Elo (Elo) 2214
7 claude-opus-4-7-thinking 1558 Elo (Elo) 10534
8 claude-opus-4-7 1555 Elo (Elo) 9976
9 claude-opus-4-6-thinking 1542 Elo (Elo) 12919
10 claude-sonnet-5-high 1542 Elo (Elo) 2959

Arena · search

查看原始排行榜

Arena 没有官方公开 API。数据来自每日结构化镜像,并始终链接回官方排行榜。

排名精确模型版本成绩指标样本 / 投票
1 claude-opus-4-6-search 1255 Elo (Elo) 105728
2 gpt-5.5-search 1239 Elo (Elo) 61253
3 claude-opus-4-7 1235 Elo (Elo) 62150
4 claude-fable-5 1230 Elo (Elo) 9895
5 ernie-5.1 1227 Elo (Elo) 3803
6 claude-sonnet-4-6-search 1222 Elo (Elo) 105370
7 gemini-3.1-pro-grounding 1211 Elo (Elo) 83445
8 claude-opus-4-8 1207 Elo (Elo) 42248
9 gemini-3-pro-grounding 1207 Elo (Elo) 37277
10 gpt-5.2-search 1206 Elo (Elo) 52708

如何解读

LiveBench 展示客观任务的类别分数。Arena 展示盲测人类偏好 Elo。SWE-bench Verified 展示特定代理配置解决真实仓库问题的比例。

重要限制

不同基准的分数不能相加或直接比较。生活场景使用偏好代理,因为目前没有覆盖通用日常助手的权威基准。