多基准对比
自选模型在多个基准上的成绩对照。每列使用该基准的默认口径(来源与评测条件见列头悬浮提示), 名次只在所选模型集合内计算(稠密名次,并列同名次)。
基准(点击增删;默认给 AIHOT 系列三个)
模型(勾选加入对比,可搜索;共 72 款有分模型)
已选模型(首页被折叠的模型也可在此对比)
↑ 加粗=本列第一;角标=所选集合内名次;「—」=该口径无成绩。选择会同步到地址栏,可直接分享链接。
| 模型 | AIHOT 综合评分 ↑ points | AIHOT 编程评分 ↑ points | AIHOT 推理评分 ↑ points |
|---|---|---|---|
| Claude Opus 5.5 Anthropic | 73.91 | 74.51 | 772 |
| Gemini 4 Argon Google | 73.82 | 723 | 754 |
| Claude Fable 5.1 Anthropic | 72.43 | 71.94 | 74.46 |
| gpt-6-astra OpenAI | 71.44 | 69.85 | 77.91 |
| Claude Sonnet 5.5 Anthropic | 71.44 | 74.22 | 74.55 |
| Claude Fable 5 Anthropic | 705 | 69.56 | 69.98 |
| gpt-6.1-sol OpenAI | 69.16 | 66.78 | 763 |
| Claude Opus 5 Anthropic | 697 | 67.27 | 717 |