
GPT-5.6再次刷新AI智能天花板!
OpenAI重磅发布《GPT-5.6构建者指南》,交出了一份亮眼的成绩单。
在ARC-AGI-3上,GPT-5.6 Sol的性能从13.3%飙到38.3%,输出Token暴降6倍。
另一边,「超小杯」Luna表现同样惊艳:
在BrowseComp测试中,它以84.04%性能直逼GPT-5.5(84.36%),更将成本从33.27 美元打到1.33美元。

此外,官方还附上了「保姆级」教程,教初创团队如何以更低成本跑GPT-5.6。

仅一个月的时间,GPT-5.6 Sol内部悄悄完成进化。
一直以来,ARC-AGI-3是顶尖AI还未拿下50%的最难测试,测试规则非常简单——
把AI丢进一堆没见过的2D小游戏里,不给说明书,让它自己摸索规则怎么玩。
结果,GPT-5.6 Sol在官方榜上只拿了7.8%,而GPT-5.5仅有0.4%。
就拿上一代对比来看,同一个Sol在ARC-AGI-2上考了92.5%分,还通关了《宝可梦·火红》。
为此,OpenAI两位研究员Ilan Bigio和Ted Sanders去查了原因,问题出现在harness上。

ARC官方的「通用harness」干了两件事:每走一步,就把模型的私有推理过程丢掉;上下文一满,就从最老的开始截断。
也就是说,模型每走一步,记忆就会被清空,然后再重来一遍。
于是,团队把harness换成Responses API,打开两个开关「推理保留」和「压缩」,重新跑了一遍公开题集。
没想到,GPT-5.6 Sol从13.3%飙到38.3%,且输出Token减少6倍。
这份《建造者指南》里,最抓眼球的一组对比,来自BrowseComp。
这是OpenAI自己打造的,一个专考「能不能在全网输出冷门事实」的榜单。
三个月前,GPT-5.5开到Extra High档,拿下84.36%,总花费33.27美元。

现在,GPT-5.6家族里最小最便宜的Luna,同样Extra High,拿下84.04%,花了1.33美元。
虽然成绩仅差0.32%,但成本砍了足足25倍。
当然了,OpenAI想要说的是——
三个月前,只有旗舰GPT才能干的活儿,现在最低档的小模型Luna,也能做到八九不离十。
指南中,OpenAI还给出了另外三种方式,都是让GPT-5.6实现更低成本部署。
第一个,是程序化工具调用(Programmatic Tool Calling)。
以前的Agent像个事必躬亲的老板:每收到一份材料,都需亲自过目一遍,才能说下一步干什么——调100次工具,就得来回100趟。
现在模型可以直接写一段JavaScript,在沙箱里把工具批量调完、筛完、汇总完,只把最后那张表拿回自己眼前。
金融研究公司Rogo的实测结果,质量打平的前提下,输入Token少用了21%。
第二个,是「原生多智能体」。
主模型当工头,把活拆给一群子模型并行去干,最后收回来汇总。
ChatGPT里那个ultra档位,本来就是这么跑的,默认四个agent同时开工。
产品公司Obvious的联创Jon Bell说,他们一口气扔了六份需求进去,边写边搭边讨论,全程没散架。
第三个,是「提示词缓存」。
缓存有效期拉长到至少30分钟,断点还能自己指定位置。
AI公司Ploy的工程师给一段29000 token的共享提示词加了断点和工作区专属键,未命中缓存的输入直接少了28%。
同一天,OpenAI放出了Ultrafast模式预览版。
GPT-5.6 Sol,最高14倍速,每秒吐出750个token,先在OpenAI API上线。
这件事的分量在于,它撕掉了一条用了两年的潜规则——想要实时响应,就得退而求其次换个小模型。
现在不用了,Ultrafast跑的还是那个Sol,智能水平一点没减。
Cerebras自己做了一组对照,选的题是Humanity's Last Exam——2500道通常只有博士才答得上来的题。
Sol Ultrafast跑完全部2500题,用时11小时11分。
Claude Fable 5跑同一批题,用了78小时27分,三天多。
准确率相当,速度差了近7倍。
提分、降本、提速,短短一个月的时间,GPT-5.6完成了一次真正意义上的全方位进化。
声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。
提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。
Web3.01
FT中文网
金色财经 善欧巴
DeepSeek Harness 团队
链捕手ChainCatcher
树图区块链
