一看就懂
AI 的成绩单
怎么看
以 2026 年 9 月新出的 Claude Opus 5.5 为例
讲给从没看过这种表的人
1
一句话
五个 AI 考了同一张九门课的卷子。新来的这个,九门里七门考了第一。
这张表是出它的公司自己发的——就像学生自己把成绩单贴出来。分数是真考的,但挑哪几门、怎么排版,是它自己选的。
2
考试的是谁
Opus 5.5 新来的,今天的主角 Anthropic 出的
Fable 5.1 同一家最贵、最强的那个 Anthropic
Opus 5 它的上一代,拿来对比进步 Anthropic
GPT-6 Astra 对手家最强的 OpenAI 出的
GPT-5.6 Sol 对手家另一个 OpenAI
表里写"—"的格子,是那个 AI 没参加这门考试,不是考了零分。
3
这种考试
跟普通考试差在哪
以前考 AI
出一道题,它写一段答案
像笔试:答对答错看字面
现在考 AI
给它一台电脑、一件活,让它自己动手干完
像实操考:交上来的东西能不能用,才算分
表里好几门写着"智能体"——意思就是"让它自己动手干活",不是光回答问题。
4
九门课,逐门看
大字是 Opus 5.5 的分。灰底的两门它没拿第一。
Terminal-Bench 4.0
只给它一个打字指挥电脑的窗口,活全靠它一条条命令敲完。100 件活干成 66 件。
第一,领先第二名 8 分多——这一门拉开得最远
FrontierCode
挑的是专业程序员也要琢磨一阵的真实任务。
第一,但对手是 53.3,只差一分,基本算打平
CursorBench
程序员天天用的一款写代码软件,出题方拿真实工作来考。
第一
GDPval-AA
律师、会计、分析师平时交的那种文件,两个 AI 各做一份,让人挑哪份好。这门不是百分制,是像下棋那样的"等级分",赢得越多分越高。
第一,比上一代高 138 分
AutomationBench
比如"收到邮件→填进表格→通知同事"这种一连串的活。
输了:对手 41.4。这门是别家公司代考的,防护一拦就算失败(见第 5 段)
Humanity's Last Exam · 人类最后的考试
全世界各领域专家专门出来难倒 AI 的题,允许查资料、用计算器。
第一
Terminal-Bench-Science
让它自己设计、跑实验、出结果。
输了:对手 64.6。但比它上一代的 29.0 翻了一倍
OSWorld
看着屏幕,自己点鼠标、打字、开软件,把一件事办完。
第一
Chartography
给一张柱状图、折线图,问它上面的数是多少、哪个涨得最快。
第一,但第二名 88.4,不到一分,算打平
5
表底下那行小字
比分数还要紧
考试时"开到最卖力"它平时默认是中等卖力。你日常用,一般到不了表里这个分。
考试时带着安全锁碰到网络攻防、生物这类敏感题,安全锁会把题转给旧版去答。所以有几门分数是被自己的锁拉低的。
每门都有 2 到 5 分的晃动同一张卷子重考,分数会上下浮动几分。差一两分不算真赢,差十分才算。
6
成绩单说明不了的
考得好,不等于干你的活就好
这九门都是出题人挑的题。你让它写文案、做表、回客户,表里一门都没考到。
"那我该不该换它?"
表告诉你:让它自己动手的活——写代码、操作电脑——它进步最大。
但最准的考卷是你自己的活:拿同一件事,新旧各让它做一遍,看哪份你更想用。