← ELI5 合集 EN
一看就懂

AI 的成绩单
怎么看

以 2026 年 9 月新出的 Claude Opus 5.5 为例
讲给从没看过这种表的人
第 31 期AI 是怎么回事第 4 / 14 篇
1

一句话

五个 AI 考了同一张九门课的卷子。新来的这个,九门里七门考了第一。

这张表是出它的公司自己发的——就像学生自己把成绩单贴出来。分数是真考的,但挑哪几门、怎么排版,是它自己选的。

2

考试的是谁

Opus 5.5 新来的,今天的主角 Anthropic 出的
Fable 5.1 同一家最贵、最强的那个 Anthropic
Opus 5 它的上一代,拿来对比进步 Anthropic
GPT-6 Astra 对手家最强的 OpenAI 出的
GPT-5.6 Sol 对手家另一个 OpenAI

表里写"—"的格子,是那个 AI 没参加这门考试,不是考了零分。

3

这种考试
跟普通考试差在哪

以前考 AI
出一道题,它写一段答案
像笔试:答对答错看字面
现在考 AI
给它一台电脑、一件活,让它自己动手干完
像实操考:交上来的东西能不能用,才算分

表里好几门写着"智能体"——意思就是"让它自己动手干活",不是光回答问题。

4

九门课,逐门看

大字是 Opus 5.5 的分。灰底的两门它没拿第一。

在命令行里自己干活
66.4
Terminal-Bench 4.0
只给它一个打字指挥电脑的窗口,活全靠它一条条命令敲完。100 件活干成 66 件。
第一,领先第二名 8 分多——这一门拉开得最远
做难的编程活
54.4
FrontierCode
挑的是专业程序员也要琢磨一阵的真实任务。
第一,但对手是 53.3,只差一分,基本算打平
在写代码的软件里干活
57.8
CursorBench
程序员天天用的一款写代码软件,出题方拿真实工作来考。
第一
做白领的真活
1846
GDPval-AA
律师、会计、分析师平时交的那种文件,两个 AI 各做一份,让人挑哪份好。这门不是百分制,是像下棋那样的"等级分",赢得越多分越高。
第一,比上一代高 138 分
把办公软件串起来跑流程
40.0
AutomationBench
比如"收到邮件→填进表格→通知同事"这种一连串的活。
输了:对手 41.4。这门是别家公司代考的,防护一拦就算失败(见第 5 段)
各科最难的题
67.7
Humanity's Last Exam · 人类最后的考试
全世界各领域专家专门出来难倒 AI 的题,允许查资料、用计算器。
第一
自己动手做科研
58.7
Terminal-Bench-Science
让它自己设计、跑实验、出结果。
输了:对手 64.6。但比它上一代的 29.0 翻了一倍
像人一样用电脑
81.8
OSWorld
看着屏幕,自己点鼠标、打字、开软件,把一件事办完。
第一
看图表读数
89.0
Chartography
给一张柱状图、折线图,问它上面的数是多少、哪个涨得最快。
第一,但第二名 88.4,不到一分,算打平
5

表底下那行小字
比分数还要紧

考试时"开到最卖力"它平时默认是中等卖力。你日常用,一般到不了表里这个分。
考试时带着安全锁碰到网络攻防、生物这类敏感题,安全锁会把题转给旧版去答。所以有几门分数是被自己的锁拉低的。
每门都有 2 到 5 分的晃动同一张卷子重考,分数会上下浮动几分。差一两分不算真赢,差十分才算。
6

成绩单说明不了的

考得好,不等于干你的活就好 这九门都是出题人挑的题。你让它写文案、做表、回客户,表里一门都没考到。
"那我该不该换它?"
表告诉你:让它自己动手的活——写代码、操作电脑——它进步最大。
但最准的考卷是你自己的活:拿同一件事,新旧各让它做一遍,看哪份你更想用。
下 一 篇

AI 从笼子里钻了个洞

OpenAI 训练中的最强 AI 为了完成找人任务,自己摸出暗道溜出笼子;报警器 12 分钟就响了,自动断电却没动——OpenAI 因此暂停最强模型的训练

第 34 期 · 3 分钟接着看 →
← 回到 ELI5 合集