跑分 · 更新于 2026年10月8日
Haiku 5.5 跑分成绩
Anthropic 于 2026 年 10 月 7 日发布 Claude Haiku 5.5,同时公布了八项主要跑分。下面把每一项都和 Haiku 4.5、Sonnet 5.5 以及 OpenAI 的 GPT-6 Luna 放在一起:每项测试测的是什么、进步有多大,以及第三方测试得出了什么结论。
- OSWorld 2.1,电脑操作。Haiku 4.5:15.7%
- 72.4%
- Terminal-Bench 4.0,Agent 编程。Haiku 4.5:0.0%
- 39.2%
- Humanity's Last Exam(使用工具)。Haiku 4.5:18.7%
- 57.4%
- GDPval-AA Elo,知识工作。Haiku 4.5:735
- 1620
全部成绩一览
Anthropic 公布的原始数据,未做改动。每一项都是越高越好;GDPval-AA 和 AA-Briefcase 为 Elo 分,其余为百分比。
| 测试项目 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1知识工作 · Elo 分 | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1知识工作 · Elo 分 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1电脑操作 · 离线子集 | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity's Last Exam推理 · 不使用工具 | 45.9% | 10.2% | 未公布 | 56.9% |
| Humanity's Last Exam推理 · 使用工具 | 57.4% | 18.7% | 未公布 | 64.5% |
| Terminal-Bench 4.0Agent 编程 · pass@1 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1Agent 编程 · Main | 46.4% | 未公布 | 42.4% | 52.1%xhigh 强度 |
| Chartography视觉推理 · 不使用工具 | 46.4% | 6.4% | 29.1% | 61.6% |
来源:Anthropic《Introducing Claude Haiku 5.5》,2026 年 10 月 7 日。短横线表示未公布。Sonnet 5.5 的 FrontierCode 成绩使用 xhigh 强度。测评细节见 Haiku 5.5 系统卡(system card)。
Haiku 5.5 对比 Haiku 4.5:代际飞跃
Haiku 4.5 是一个快速的聊天模型,Haiku 5.5 则是一个能干活的 Agent。进步最大的,正是那些需要模型动手、而不只是回答的测试。
Terminal-Bench 4.0 要求模型在命令行中完成多步骤的专业任务,在 Anthropic 的测试中 Haiku 4.5 得分 0.0%,Haiku 5.5 则达到 39.2%。在需要操作真实电脑完成长任务的 OSWorld 2.1 上,成绩从 15.7% 提升到 72.4%。而且成本最多降低了 90%。
Haiku 5.5 对比 GPT-6 Luna
GPT-6 Luna 是 OpenAI 的小模型,也是 Anthropic 选来对比的竞品。在两者都有成绩的六项测试中,Haiku 5.5 全部领先。
第三方测试的差距没那么大。Artificial Analysis 给 Haiku 5.5(max 强度)的智能指数为 43,高于 GPT-6 Luna 的 38;但在 high 强度下两者都是 38,而且 max 强度下 Haiku 5.5 消耗的输出 token 约为 Luna 的三倍。Artificial Analysis 还测得 Haiku 5.5 的幻觉率更低(40% 对 77%),而 Luna 的知识准确率更高(44% 对 36%)。
Haiku 5.5 离 Sonnet 5.5 有多近?
Sonnet 5.5 在每一项上都领先。真正值得问的是:花 Sonnet 每 token 价格的 1/20,能拿到它多少成绩?
在推理、电脑操作和代码补丁评审类测试上,Haiku 5.5 能达到 Sonnet 5.5 成绩的 81% 到 89%。但在长链路的 Agent 编程上差距很明显:Terminal-Bench 4.0 是 39.2% 对 70.6%。这也和 Anthropic 自己的建议一致:复杂的 Agent 编程用 Sonnet 5.5 或 Opus 5.5,Haiku 5.5 负责高并发任务并充当它们的子 Agent。
SWE-bench 成绩呢?
Anthropic 的发布文章没有包含 SWE-bench,编程类测试用的是 Terminal-Bench 4.0 和 FrontierCode。根据引用 Haiku 5.5 系统卡的发布报道,它在 SWE-bench Pro 上得分 64.8%,在 SWE-bench Multilingual 上得分 83.7%。
你可能还会看到 Haiku 4.5 的 73.3%。那是 SWE-bench Verified 的成绩,测试集不同,不能和上面的数字直接比较。
思考强度会影响成绩
Haiku 5.5 是第一款支持思考强度的 Haiku:low、medium(默认)、high、xhigh 和 max。Anthropic 在 OSWorld、GDPval-AA 和 Humanity's Last Exam 上画出了每一档的准确率与成本曲线:强度越高,分数越高,token 消耗也越多。
Artificial Analysis 的结果也是同样的曲线:Haiku 5.5 在 high 强度下智能指数为 38,max 强度下为 43;从 xhigh 提到 max 多了 2 分,token 却多用了约 1.8 倍。日常聊天用 low 或 medium 最划算,最高的几档留给难题。在 Haiku55 上,快速、智能、深度三种模式分别对应 low、medium 和 high 强度。
早期测试方的实测结果
以下是几家公司在发布时公布的自测结果:
HubSpot
在其 CRM 模拟测试集上取得 92.8%(三次运行平均),是 HubSpot 在该测试集上见过的最好成绩。
AlphaSense
在其“Ask in Document”功能的 400 个查询上得分 0.84,Haiku 4.5 为 0.76。
Box
比 Haiku 4.5 高 11 分,延迟约为其一半。
Asana
任务完成延迟降低 30% 以上,每轮 Agent 推理速度最高提升 2.5 倍。
每项测试测的是什么
- GDPval-AA v2.1知识工作
- 取材自 44 种职业的真实专业工作。模型以 Agent 方式完成任务,再通过盲评两两对比排名,换算成 Elo 分。由 Artificial Analysis 运行。
- AA-Briefcase v1.1知识工作
- Artificial Analysis 的私有测试,考察长链路商务工作:Agent 需要产出表格、演示文稿、备忘录等交付物。同样以 Elo 计分。
- OSWorld 2.1电脑操作
- 模型操作一台真实电脑,在多个桌面应用之间完成长而多步骤的任务。Anthropic 公布的 Haiku 5.5 成绩基于离线子集。
- Humanity's Last Exam推理
- Humanity's Last Exam(人类最后的考试):覆盖数十个学科的专家级难题,专门为难倒前沿模型而设计。分别公布使用工具和不使用工具两种成绩。
- Terminal-Bench 4.0Agent 编程
- 要求模型在命令行界面中完成多步骤的专业任务。按 pass@1 计分,即每个任务只有一次机会。
- FrontierCode 1.1Agent 编程
- Cognition 推出的 Agent 编程测试:模型要解决开源仓库里的真实 issue,提交的补丁由隐藏测试和维护者编写的评分标准共同评判。Main 为其中最难的 100 道题。
- Chartography视觉推理
- 图表识别:从图表和插图中读出数值与趋势。Haiku 5.5 的成绩为不使用工具。
Haiku 5.5 跑分常见问题
Claude Haiku 5.5 的跑分成绩怎么样?
它是迄今最强的 Haiku:OSWorld 2.1 得分 72.4%,Terminal-Bench 4.0 得分 39.2%,Humanity's Last Exam(使用工具)57.4%,GDPval-AA 为 1620 Elo。在 Anthropic 公布的表格里,凡是 GPT-6 Luna 有成绩的项目它都领先,但每一项都落后于 Sonnet 5.5。
Haiku 5.5 的 SWE-bench 成绩是多少?
Anthropic 的发布文章没有列出 SWE-bench。根据对 Haiku 5.5 系统卡的发布报道,它在 SWE-bench Pro 上得分 64.8%,在 SWE-bench Multilingual 上得分 83.7%。
Haiku 5.5 比 Haiku 4.5 强吗?
在所有公开的跑分上都大幅领先,例如 OSWorld 2.1 为 72.4% 对 15.7%,Terminal-Bench 4.0 为 39.2% 对 0.0%,而成本最多低 90%。
Haiku 5.5 比 GPT-6 Luna 强吗?
按 Anthropic 的表格,是的:六项共同测试全部领先。Artificial Analysis 的第三方测试显示,Haiku 5.5 在 max 强度下领先(智能指数 43 对 38),在 high 强度下与 Luna 持平。
Haiku 5.5 和 Opus 5.5 比起来怎么样?
两篇发布文章共有的跑分项目里,Opus 5.5 全部领先,例如 Terminal-Bench 4.0 为 66.4% 对 39.2%,但每 token 价格贵 40 倍。完整对比见我们的 Haiku 5.5 vs Opus 5.5 页面。
现在就免费试用 Claude Haiku 5.5
无需信用卡,无需安装,几秒钟就能问出第一个问题。
免费开始对话资料来源
- Anthropic — Introducing Claude Haiku 5.5
- Anthropic — Claude Haiku 5.5 system card
- Anthropic — Claude Haiku (availability, customer results)
- Anthropic — Introducing Claude Opus 5.5
- Artificial Analysis — Claude Haiku 5.5
- The Decoder — Claude Haiku 5.5 launch coverage
- Handy AI — Model Drop: Claude Haiku 5.5 (system card figures)
Haiku55 是独立服务,与 Anthropic 不存在隶属关系。本页价格与成绩均为 Anthropic 及上文提到的测试方公开发布的数据,核对日期为 2026年10月8日;之后如有变动,请以资料来源为准。