跑分 · 更新于 2026年10月8日

Haiku 5.5 跑分成绩

Anthropic 于 2026 年 10 月 7 日发布 Claude Haiku 5.5,同时公布了八项主要跑分。下面把每一项都和 Haiku 4.5、Sonnet 5.5 以及 OpenAI 的 GPT-6 Luna 放在一起:每项测试测的是什么、进步有多大,以及第三方测试得出了什么结论。

OSWorld 2.1,电脑操作。Haiku 4.5:15.7%
72.4%
Terminal-Bench 4.0,Agent 编程。Haiku 4.5:0.0%
39.2%
Humanity's Last Exam(使用工具)。Haiku 4.5:18.7%
57.4%
GDPval-AA Elo,知识工作。Haiku 4.5:735
1620

全部成绩一览

Anthropic 公布的原始数据,未做改动。每一项都是越高越好;GDPval-AA 和 AA-Briefcase 为 Elo 分,其余为百分比。

Claude Haiku 5.5 跑分与 Haiku 4.5、GPT-6 Luna、Sonnet 5.5 对比
测试项目Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
GDPval-AA v2.1知识工作 · Elo 分162073514371840
AA-Briefcase v1.1知识工作 · Elo 分157861413361824
OSWorld 2.1电脑操作 · 离线子集72.4%15.7%48.9%83.9%
Humanity's Last Exam推理 · 不使用工具45.9%10.2%未公布56.9%
Humanity's Last Exam推理 · 使用工具57.4%18.7%未公布64.5%
Terminal-Bench 4.0Agent 编程 · pass@139.2%0.0%16.4%70.6%
FrontierCode 1.1Agent 编程 · Main46.4%未公布42.4%52.1%xhigh 强度
Chartography视觉推理 · 不使用工具46.4%6.4%29.1%61.6%

来源:Anthropic《Introducing Claude Haiku 5.5》,2026 年 10 月 7 日。短横线表示未公布。Sonnet 5.5 的 FrontierCode 成绩使用 xhigh 强度。测评细节见 Haiku 5.5 系统卡(system card)。

Haiku 5.5 对比 Haiku 4.5:代际飞跃

Haiku 4.5 是一个快速的聊天模型,Haiku 5.5 则是一个能干活的 Agent。进步最大的,正是那些需要模型动手、而不只是回答的测试。

GDPval-AA v2.1

知识工作 · Elo 分

+885Elo

Haiku 5.5
1620
Haiku 4.5
735

AA-Briefcase v1.1

知识工作 · Elo 分

+964Elo

Haiku 5.5
1578
Haiku 4.5
614

OSWorld 2.1

电脑操作 · 离线子集

4.6×提升

Haiku 5.5
72.4%
Haiku 4.5
15.7%

Humanity's Last Exam

推理 · 不使用工具

4.5×提升

Haiku 5.5
45.9%
Haiku 4.5
10.2%

Humanity's Last Exam

推理 · 使用工具

3.1×提升

Haiku 5.5
57.4%
Haiku 4.5
18.7%

Terminal-Bench 4.0

Agent 编程 · pass@1

+39.2分

Haiku 5.5
39.2%
Haiku 4.5
0.0%

Chartography

视觉推理 · 不使用工具

7.3×提升

Haiku 5.5
46.4%
Haiku 4.5
6.4%

Terminal-Bench 4.0 要求模型在命令行中完成多步骤的专业任务,在 Anthropic 的测试中 Haiku 4.5 得分 0.0%,Haiku 5.5 则达到 39.2%。在需要操作真实电脑完成长任务的 OSWorld 2.1 上,成绩从 15.7% 提升到 72.4%。而且成本最多降低了 90%。

Haiku 5.5 对比 GPT-6 Luna

GPT-6 Luna 是 OpenAI 的小模型,也是 Anthropic 选来对比的竞品。在两者都有成绩的六项测试中,Haiku 5.5 全部领先。

GDPval-AA v2.1

知识工作 · Elo 分

+183Elo,领先 Luna

Haiku 5.5
1620
GPT-6 Luna
1437

AA-Briefcase v1.1

知识工作 · Elo 分

+242Elo,领先 Luna

Haiku 5.5
1578
GPT-6 Luna
1336

OSWorld 2.1

电脑操作 · 离线子集

+23.5分,领先 Luna

Haiku 5.5
72.4%
GPT-6 Luna
48.9%

Terminal-Bench 4.0

Agent 编程 · pass@1

+22.8分,领先 Luna

Haiku 5.5
39.2%
GPT-6 Luna
16.4%

FrontierCode 1.1

Agent 编程 · Main

+4.0分,领先 Luna

Haiku 5.5
46.4%
GPT-6 Luna
42.4%

Chartography

视觉推理 · 不使用工具

+17.3分,领先 Luna

Haiku 5.5
46.4%
GPT-6 Luna
29.1%

第三方测试的差距没那么大。Artificial Analysis 给 Haiku 5.5(max 强度)的智能指数为 43,高于 GPT-6 Luna 的 38;但在 high 强度下两者都是 38,而且 max 强度下 Haiku 5.5 消耗的输出 token 约为 Luna 的三倍。Artificial Analysis 还测得 Haiku 5.5 的幻觉率更低(40% 对 77%),而 Luna 的知识准确率更高(44% 对 36%)。

Haiku 5.5 离 Sonnet 5.5 有多近?

Sonnet 5.5 在每一项上都领先。真正值得问的是:花 Sonnet 每 token 价格的 1/20,能拿到它多少成绩?

OSWorld 2.1

电脑操作 · 离线子集

86%占 Sonnet 5.5 成绩

Haiku 5.5
72.4%
Sonnet 5.5
83.9%

Humanity's Last Exam

推理 · 不使用工具

81%占 Sonnet 5.5 成绩

Haiku 5.5
45.9%
Sonnet 5.5
56.9%

Humanity's Last Exam

推理 · 使用工具

89%占 Sonnet 5.5 成绩

Haiku 5.5
57.4%
Sonnet 5.5
64.5%

Terminal-Bench 4.0

Agent 编程 · pass@1

56%占 Sonnet 5.5 成绩

Haiku 5.5
39.2%
Sonnet 5.5
70.6%

FrontierCode 1.1

Agent 编程 · Main

89%占 Sonnet 5.5 成绩

Haiku 5.5
46.4%
Sonnet 5.5
52.1%

Chartography

视觉推理 · 不使用工具

75%占 Sonnet 5.5 成绩

Haiku 5.5
46.4%
Sonnet 5.5
61.6%

在推理、电脑操作和代码补丁评审类测试上,Haiku 5.5 能达到 Sonnet 5.5 成绩的 81% 到 89%。但在长链路的 Agent 编程上差距很明显:Terminal-Bench 4.0 是 39.2% 对 70.6%。这也和 Anthropic 自己的建议一致:复杂的 Agent 编程用 Sonnet 5.5 或 Opus 5.5,Haiku 5.5 负责高并发任务并充当它们的子 Agent。

SWE-bench 成绩呢?

Anthropic 的发布文章没有包含 SWE-bench,编程类测试用的是 Terminal-Bench 4.0 和 FrontierCode。根据引用 Haiku 5.5 系统卡的发布报道,它在 SWE-bench Pro 上得分 64.8%,在 SWE-bench Multilingual 上得分 83.7%。

你可能还会看到 Haiku 4.5 的 73.3%。那是 SWE-bench Verified 的成绩,测试集不同,不能和上面的数字直接比较。

思考强度会影响成绩

Haiku 5.5 是第一款支持思考强度的 Haiku:low、medium(默认)、high、xhigh 和 max。Anthropic 在 OSWorld、GDPval-AA 和 Humanity's Last Exam 上画出了每一档的准确率与成本曲线:强度越高,分数越高,token 消耗也越多。

Artificial Analysis 的结果也是同样的曲线:Haiku 5.5 在 high 强度下智能指数为 38,max 强度下为 43;从 xhigh 提到 max 多了 2 分,token 却多用了约 1.8 倍。日常聊天用 low 或 medium 最划算,最高的几档留给难题。在 Haiku55 上,快速、智能、深度三种模式分别对应 low、medium 和 high 强度。

早期测试方的实测结果

以下是几家公司在发布时公布的自测结果:

  • HubSpot

    在其 CRM 模拟测试集上取得 92.8%(三次运行平均),是 HubSpot 在该测试集上见过的最好成绩。

  • AlphaSense

    在其“Ask in Document”功能的 400 个查询上得分 0.84,Haiku 4.5 为 0.76。

  • Box

    比 Haiku 4.5 高 11 分,延迟约为其一半。

  • Asana

    任务完成延迟降低 30% 以上,每轮 Agent 推理速度最高提升 2.5 倍。

每项测试测的是什么

GDPval-AA v2.1知识工作
取材自 44 种职业的真实专业工作。模型以 Agent 方式完成任务,再通过盲评两两对比排名,换算成 Elo 分。由 Artificial Analysis 运行。
AA-Briefcase v1.1知识工作
Artificial Analysis 的私有测试,考察长链路商务工作:Agent 需要产出表格、演示文稿、备忘录等交付物。同样以 Elo 计分。
OSWorld 2.1电脑操作
模型操作一台真实电脑,在多个桌面应用之间完成长而多步骤的任务。Anthropic 公布的 Haiku 5.5 成绩基于离线子集。
Humanity's Last Exam推理
Humanity's Last Exam(人类最后的考试):覆盖数十个学科的专家级难题,专门为难倒前沿模型而设计。分别公布使用工具和不使用工具两种成绩。
Terminal-Bench 4.0Agent 编程
要求模型在命令行界面中完成多步骤的专业任务。按 pass@1 计分,即每个任务只有一次机会。
FrontierCode 1.1Agent 编程
Cognition 推出的 Agent 编程测试:模型要解决开源仓库里的真实 issue,提交的补丁由隐藏测试和维护者编写的评分标准共同评判。Main 为其中最难的 100 道题。
Chartography视觉推理
图表识别:从图表和插图中读出数值与趋势。Haiku 5.5 的成绩为不使用工具。

Haiku 5.5 跑分常见问题

Claude Haiku 5.5 的跑分成绩怎么样?

它是迄今最强的 Haiku:OSWorld 2.1 得分 72.4%,Terminal-Bench 4.0 得分 39.2%,Humanity's Last Exam(使用工具)57.4%,GDPval-AA 为 1620 Elo。在 Anthropic 公布的表格里,凡是 GPT-6 Luna 有成绩的项目它都领先,但每一项都落后于 Sonnet 5.5。

Haiku 5.5 的 SWE-bench 成绩是多少?

Anthropic 的发布文章没有列出 SWE-bench。根据对 Haiku 5.5 系统卡的发布报道,它在 SWE-bench Pro 上得分 64.8%,在 SWE-bench Multilingual 上得分 83.7%。

Haiku 5.5 比 Haiku 4.5 强吗?

在所有公开的跑分上都大幅领先,例如 OSWorld 2.1 为 72.4% 对 15.7%,Terminal-Bench 4.0 为 39.2% 对 0.0%,而成本最多低 90%。

Haiku 5.5 比 GPT-6 Luna 强吗?

按 Anthropic 的表格,是的:六项共同测试全部领先。Artificial Analysis 的第三方测试显示,Haiku 5.5 在 max 强度下领先(智能指数 43 对 38),在 high 强度下与 Luna 持平。

Haiku 5.5 和 Opus 5.5 比起来怎么样?

两篇发布文章共有的跑分项目里,Opus 5.5 全部领先,例如 Terminal-Bench 4.0 为 66.4% 对 39.2%,但每 token 价格贵 40 倍。完整对比见我们的 Haiku 5.5 vs Opus 5.5 页面。

现在就免费试用 Claude Haiku 5.5

无需信用卡,无需安装,几秒钟就能问出第一个问题。

免费开始对话

资料来源

  1. Anthropic — Introducing Claude Haiku 5.5
  2. Anthropic — Claude Haiku 5.5 system card
  3. Anthropic — Claude Haiku (availability, customer results)
  4. Anthropic — Introducing Claude Opus 5.5
  5. Artificial Analysis — Claude Haiku 5.5
  6. The Decoder — Claude Haiku 5.5 launch coverage
  7. Handy AI — Model Drop: Claude Haiku 5.5 (system card figures)

Haiku55 是独立服务,与 Anthropic 不存在隶属关系。本页价格与成绩均为 Anthropic 及上文提到的测试方公开发布的数据,核对日期为 2026年10月8日;之后如有变动,请以资料来源为准。