多基准对比

自选模型在多个基准上的成绩对照。每列使用该基准的默认口径(来源与评测条件见列头悬浮提示), 名次只在所选模型集合内计算(稠密名次,并列同名次)。

💰 返回榜单

基准(点击增删;默认给 AIHOT 系列三个)

模型(勾选加入对比,可搜索;共 72 款有分模型)

已选模型(首页被折叠的模型也可在此对比)

↑ 加粗=本列第一;角标=所选集合内名次;「—」=该口径无成绩。选择会同步到地址栏,可直接分享链接。

模型 AIHOT 综合评分 ↑ points AIHOT 编程评分 ↑ points AIHOT 推理评分 ↑ points
Claude Opus 5.5 Anthropic 73.91 74.51 772
Gemini 4 Argon Google 73.82 723 754
Claude Fable 5.1 Anthropic 72.43 71.94 74.46
gpt-6-astra OpenAI 71.44 69.85 77.91
Claude Sonnet 5.5 Anthropic 71.44 74.22 74.55
Claude Fable 5 Anthropic 705 69.56 69.98
gpt-6.1-sol OpenAI 69.16 66.78 763
Claude Opus 5 Anthropic 697 67.27 717