免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    一夜之间 GPT-5.6 Sol被OpenAI加速了14倍

    AI 开始卷信息不对等了?

    8 月 14 日凌晨,OpenAI 联合 AI 芯片厂商 Cerebras 正式预览了其旗舰模型 GPT-5.6 Sol 的全新服务层级「超高速模式」(Ultrafast Mode)。

    在该模式下,GPT-5.6 Sol 的输出速度最高可达 750 tokens/s,相比目前 Standard(标准)模式约 53 tokens/s 的推理基线,速度提升最高达 14 倍,同时不降低任何质量。横向对比的话,GPT-5.6 Sol 加速后比 Fable 5 快 11 倍,比 Opus 4.8 在 Fast 模式下快 5 倍。

    Ultrafast 模式将率先在 OpenAI API 中推出,当前已面向部分客户推出有限预览版。

    bAQoBcqsQtLcXQslfa8Nrz5Ybg75WNzNXpTlxndD.jpeg

    为此,OpenAI 与 Cerebras 还对当前先进 AI 大模型现在的速度和智力对比拉了个表格,GPT-5.6 Sol Ultrafast 处于绝对领先的位置:

    iLwTVDtpZPqNa6EEw51seGUifK2E3dEt9b0FcStJ.jpeg

    在 Cerebras 的博客中,工程人员介绍了在「人类最后的考试」(Humanity's Last Exam, HLE)上进行的测试,他们把 Ultrafast 后的模型与直接竞对进行了对比。我们知道,HLE 是一项具有挑战性的模型基准,包含 2500 道题,通常只有化学、经济学和文学等领域的博士才能解答。

    GPT-5.6 Sol 在超快模式下仅用 11 小时 11 分钟就回答了全部问题而 Claude Fable 5 则需要 78 小时 27 分钟,也就是超过三天的连续计算才能得出相同的结论。GPT 超快模式仅用一个工作日就完成了人类知识的前沿领域,在准确率相近的同时,速度几乎是 Claude Fable 的 7 倍。

    2C3rMD2DlxMFKiH0cfdfL7f5UlDzIB7bhl3CIJb0.jpeg

    随着模型能力的不断提升,快速推理的应用范围也会扩大。GPT-5.6 Sol 是 OpenAI 迄今为止在法律文书、金融模型和工程报告方面表现最佳的模型。在 GDP-Val(衡量经济价值知识工作任务的基准)上,Ultrafast 实现了 5.6 倍的端到端速度提升,且质量未受影响,充分展现了更快的推理速度如何加速经济价值工作的开展。

    LabfyCwbeZWBtF5S0Qm4aUkS5DM3lOodNGATnGV7.jpeg

    更快的 AI 处理速度为新兴工作流增加了不少可能性,人们现在可以将智能体部署到问题的关键路径上。OpenAI 为你列举了一些应用场景:

    • 事件响应和可靠性:当关键系统发生故障时,AI 分析应用程序日志、最近的代码更改和工程师报告,以确定可能的原因,并在故障仍在发生时帮助准备修复方案。

    • 金融研究与安全:在市场形势瞬息万变的情况下,分析市场信号、评估交易并识别可疑活动。

    • 客户支持和语音:实时解决复杂的客户问题,即使找到答案需要多个步骤或系统,也不会中断对话。

    • 商务:在购物者还在犹豫不决时,回答产品问题、检查库存、个性化推荐并解决结账问题,避免犹豫演变成放弃购物车。

    • 实时研究和实验:将以前需要一夜才能完成的研究变成交互式工作会议,让团队测试想法、检查结果、调整方法,并在不中断工作流程的情况下进行另一次实验。

    在 OpenAI 内部,开发人员在超快速模式下测试了 GPT-5.6 Sol,事件响应是使用 Ultrafast 的一个例子。当警报触发时,工程师需要在系统和证据仍在变化的情况下构建准确的事件图景。借助 Sol 级别的智能,团队可以快速读取日志、分析跟踪信息、汇总对话、确定下一步检查,并协助准备或验证修复方案。Ultrafast 模式缩短了从观察到信号、验证假设到选择下一步行动之间的延迟,同时工程师仍然负责判断和部署。

    在研究方面,OpenAI 团队使用 Ultrafast 来快速搜索知识库、查询数据,并快速收集、整理和汇总来自不同工具的信息。以往研究中常见的流程是,团队成员在夜间启动一批实验,并在第二天早上查看结果。而有了 Ultrafast,发现的流程可以缩短,从而支持在工作日内进行多次迭代。

    Ultrafast 模式的突破在于打破了传统 GPU 集群在大模型推理解码阶段的内存带宽瓶颈,其实现主要依赖于 Cerebras 的晶圆级硬件架构。

    3BeBUfvbRGX84cfdOgiaxxvrDa3BoFSvTMaM4BLh.jpeg

    在 AI 芯片厂商行列中,Cerebras 的解决方案独树一帜:其历代芯片采用整片晶圆制成,在单片上集成了海量计算核心与超高速互联网络。

    传统 GPU 在运行大模型自回归解码生成 Token 时,受限于显存带宽,需要不断将庞大的模型权重在片外 HBM 和计算核心之间往返搬运;同时多卡切分还会带来跨芯片互连(PCIe/NVLink)的通信延迟。

    而每块 Cerebras 最新的晶圆级芯片(WSE-3)集成了 4 万亿晶体管,125 petaflops 的 AI 算力和高达 44 GB 的片上高速 SRAM,模型参数直接全部常驻在超高带宽的片上 SRAM 中,避免了反复从片外内存加载权重的等待时间。

    当然,GPT-5.6 Sol 作为前沿旗舰模型,完整参数量显然远超芯片容量。Cerebras 还有「多晶圆流水线并行(Pipelined across wafers)」机制,其将模型的各网络层分别分布于多颗晶圆上,每层参数常驻于各自芯片的 SRAM 中,能让 Token 在晶圆间无缝流水传输。

    对于众多大模型用户来说,旗舰模型 14 倍速会意味着以前不少必须切换次级模型(如 Luna 和 Terra)的任务现在可以直接放心地满血跑,对于需要多轮工具调用、代码生成排错和复杂链式思考的 Agent 任务,原本需要几小时的流程可压缩至几分钟完成。

    更快的速度或许也意味着我们使用 AI 的方式发生转变:

    kSub0Kjwdy8Q7ZCM2LIZq0Wt6E5tWx6uay5igQYa.jpeg

    AI 社区里,人们已经在期待 Luna 和 Terra 版的超高速模式了,就是不知道 Cerebras 的芯片是否够用。

    jinse.com.cn 0
    好文章,需要你的鼓励
    jinse.com.cn 0
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 机器之心 > 一夜之间 GPT-5.6 Sol被OpenAI加速了14倍
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部