免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    Fable 5.1来了 号称全球最强 Anthropic也开始卷“缓存价格”

    lrEivDTCCI4dEuNHCH8zE6ITNHvLsxDRih2tKku5.jpeg

    作者:晓静,腾讯科技

    美国当地时间9月1日,Anthropic同时发布了Claude Fable 5.1和Claude Mythos 5.1。

    这两款模型使用相同的底层模型,但安全限制不同。Fable 5.1已经广泛开放,面向Pro、Max、Team和Enterprise用户,并通过Claude API及主流云平台提供。Mythos 5.1过审核机制向部分网络安全和生命科学专业用户开放,目前访问范围仍然非常有限。

    gK741DTNJVxG2Gz8cSd3U3ydtns0iH6vwatqNGGt.jpeg

    Fable 5.1的输入和输出价格没有变化,但缓存读取价格下降75%。按照Anthropic的测算,典型工作负载的整体成本较Fable 5降低约25%,复杂编码和高度代理化任务的成本最高可降低约45%。

    Anthropic同时推出Enterprise Frontier Safeguards(EFS),允许企业将相关数据保存在自己控制的云基础设施中。对于符合条件的客户,在EFS正式提供之前,也可以使用Fable 5.1的零数据保留模式。

    在模型能力方面,Fable 5.1在编码、科学研究、知识工作和业务自动化等测试中的成绩均高于Fable 5。Anthropic还公布了早期客户的实际使用案例,包括长时间运行的机器学习任务、软件故障排查和浏览器智能体任务。

    一项科研Agent测试,得分是GPT-5.6 Sol的2.3倍

    Anthropic这次对Fable 5.1的定位发生了明显变化:模型需要自己处理更长、更复杂的任务,并在执行过程中不断检查结果、调用工具和调整路径。

    Anthropic自己公布的测试结果显示,在Terminal-Bench-Science 0.1中,Fable 5.1得分52.6%,超过GPT-5.6 Sol(22.4%)一倍,Fable 5为24.7%,Opus 5为29.0%。这项测试考察的是AI智能体执行科学研究任务的能力,模型需要在终端环境中完成连续的研究工作。

    CHV6HnD8luUeWNCW5ptow2RP6drerVj4V7W8RZ64.jpeg

    在Terminal-Bench 4.0中,Fable 5.1得分55.8%,高于Fable 5的42.0%和Opus 5的52.3%。如果放宽安全限制,使用同一底层模型的Mythos 5.1得分进一步提高到60.9%,成为这项测试中成绩最高的版本。

    类似的提升也出现在知识工作和业务自动化任务中。Fable 5.1在GDPval-AA v2中获得1853分,高于Opus 5的1824分和Fable 5的1723分;在AutomationBench中获得31.4%,Fable 5和Opus 5分别为17.1%和26.9%;在CursorBench 3.2.0中则达到73.4%。

    b16cgLgMhMkAqtPQAywVknotIGkReMD4lRKZ1pYg.jpeg

    这些测试结果反映出的变化,是模型能够在更长的任务链中保持工作状态。Anthropic公布的早期客户案例更能说明这一点。

    投资公司Millennium遇到过一个极少出现的软件崩溃问题,大约每运行100万次才发生一次。这个问题已经困扰该团队四五年,包括此前使用过的模型在内,都没有找到原因。Fable 5.1最终对外部供应商的软件库进行了反汇编,并将结果与系统崩溃时留下的核心转储文件进行比对,最后把问题定位到了该软件库中的一个Bug。

    04A3bQkxG8ntwoOh5DCIcFCegoSmzBozZYvGkn67.jpeg

    Ramp测试的则是一项持续运行的机器学习任务。Fable 5.1在无人值守的情况下运行了38小时,重新检查此前得到的结果后,判断其中存在标签造成的误差,并进一步启动6项实验。实验运行一夜后,模型返回新的结果以及下一步建议。

    还有一些任务更加接近企业日常使用场景。Browserbase让Fable 5.1执行浏览器智能体任务,在其最困难的一项测试中完成率达到82%,高于Opus 5的74%和Fable 5的57%。Jane Street Capital则表示,在内部测试中,Fable 5.1解决的编码问题多于Fable 5和Opus 5,而且在长时间、多步骤任务中,输出仍然比较容易理解。

    从这些案例看,Fable 5.1需要处理的已经不只是一个问题对应一个答案。一次任务可能从读取资料开始,经过代码分析、工具调用、实验验证,再回到前面的结果重新判断,最后形成可以交付的结果。

    科研任务是Anthropic此次重点展示的另一类应用。

    其中最值得关注的是蛋白质设计。现代药物研发中,很多药物需要先找到能够与人体内特定目标结合的蛋白质。Anthropic让Mythos 5.1使用开源蛋白质设计和折叠工具完成设计,再把模型生成的结果交给两家外部机构进行实验验证。

    bLcqziSeHI1A3tNPZQOWXus350dYcO91q7nHAQNr.jpeg

    在12个目标上,Mythos 5.1生成的设计中,接近50%最终被验证为有效结合剂。Anthropic称,目前蛋白质设计中的典型命中率大约为10%至15%。

    在其中三个目标上,模型设计出的结合剂结合能力达到此前Adaptyv Bio蛋白质设计竞赛最佳设计的10倍。

    这项测试的意义在于,模型承担的工作已经涉及实验之前的设计环节。它可以根据目标生成方案,再利用现有的蛋白质设计和折叠工具进行计算,最后将候选结果交给实验人员验证。

    Anthropic还公布了一个计算建模案例。Fable 5.1利用NASA的麦哲伦号任务30多年前获取的雷达图像,以及覆盖金星约五分之一范围的已有地图,训练神经网络,重新生成了覆盖金星约三分之一范围的高分辨率高程图。

    YZiJkOZTzITYriIVDYO3qaZWsMehoNDvelQmaY4d.jpeg

    9Jx45NuuFtAkxc1yceOjZ36IipkA1ZKprvSSJdMK.jpeg

    新地图可以看到约2至3公里尺度的细节,原有地图的分辨率约为10至20公里,同时高度测量准确度最多提高25%。Anthropic计划在NASA的VERITAS任务和ESA的EnVision任务开展后续工作前,以Creative Commons许可证公开这张地图。

    计算生物学方面,Mythos 5.1把重点放在计算效率上。

    科研人员经常需要在GPU上反复运行专门的机器学习模型,而计算速度会直接影响实验进度。Mythos 5.1通过编写定制GPU内核,并缓存中间结果,将7个开源深度学习模型的推理速度提高了最高2.5倍,而且输出结果保持一致。

    f3PDwTRjp5YWklx8cxiASl1EHxqZHnRt4zja4Ls4.jpeg

    这些模型包括ChromBPNet、Flashzoi、Enformer、Profluent-E1、ProGen2和不同规模的Evo2。按照Anthropic的估算,在基因组范围的分析中,优化后的模型可以减少30%至60%的GPU成本。

    Anthropic表示,这类优化过去通常需要性能工程团队花费数周完成,而Mythos 5.1只用了几天,并且只使用公开的源代码。相关优化计划后续开源。

    相同底层模型 两套安全机制

    Fable 5.1和Mythos 5.1虽然是同一个模型,但使用范围并不一样。

    Fable 5.1已经面向所有平台提供,包括AWS、Google Cloud和Microsoft Azure,开发者也可以通过Claude API调用claude-fable-5-1。

    在安全策略方面,Anthropic此次重点调整了网络安全和生命科学领域的限制。

    网络安全方面,Fable 5.1现在可以帮助用户发现软件漏洞,用于防御性安全工作。Anthropic表示,与此前Fable 5使用的网络安全防护相比,新的防护机制在Claude Code中的平均干预次数减少约60%。

    生命科学领域则仍然采取更严格的方式。普通用户涉及研究和开发的生命科学任务仍会被转向Opus模型,而专业人员可以通过生命科学验证计划申请Mythos 5.1的访问权限。该计划已经与美国政府合作,并已经有首批参与者。

    Mythos 5.1还将通过网络安全验证计划向经过审核的网络安全人员开放。Claude Security目前也已经由Mythos 5.1提供支持,用于扫描代码库中的漏洞并提出供人工审核的修复方案。

    与此同时,Anthropic也强化了数据隐私和企业安全机制。

    新的Enterprise Frontier Safeguards,即EFS,可以让企业把数据存放在自己控制的云基础设施中,而不是Anthropic的系统里。默认情况下,涉及人工审核的工作也由企业自行完成。EFS将从今年秋季开始分阶段推出,在正式支持之前,符合条件的企业可以使用Fable 5.1的零数据保留模式。

    Anthropic表示,EFS是在与100多家企业合作后开发的,参与企业覆盖金融、医疗、制造、电信、法律、零售和公共部门等领域。

    从这次发布来看,Fable 5.1的升级集中在几个非常具体的地方:代码能力更强,长任务更稳定,科研任务开始出现实际案例,缓存读取价格下降,同时企业可以获得更明确的数据控制方式。

    对普通用户来说,最直接的变化可能是模型处理复杂任务时更容易持续完成工作;对企业来说,成本下降和数据保留机制则降低了长期使用的门槛。Anthropic也通过Mythos 5.1把更强的网络安全和生命科学能力交给经过审核的专业用户。

    Fable 5.1由此成为Anthropic当前面向生产环境的主力模型之一,而科研和高风险专业场景,则被单独放进了Mythos 5.1的受控访问体系。

    缓存价格降了75%

    Fable 5.1这次调整的不只是模型能力和安全机制,还有使用成本。

    Anthropic保留了Fable 5.此前的标准API价格,输入每百万Token 10美元,输出每百万Token 50美元,没有直接降低基础价格。但缓存读取价格从每百万Token 1美元降到了0.25美元,降幅达到75%。

    aHzKINSNSumUuEq7B92JYmGqoOY2bmMyDgCbE54I.jpeg

    Anthropic按照2026年8月的实际使用情况测算,典型工作负载的整体成本可以降低约25%。对于高度Agent化、缓存读取占比较高的任务,成本降幅更高。

    不过,第三方测评机构Artificial Analysis的测试显示,缓存价格下降并不意味着每项任务的实际成本都会下降。其数据显示,在最高推理强度下,Fable 5.1完成一次Intelligence Index任务的平均成本为3.76美元,比Fable 5高20%。主要原因是Fable 5.1使用的输出Token约为Fable 5的1.7倍。

    hWnEDFzel7M1YTixGtVjpZo64halNdpK2WwGqFIG.jpeg

    缓存价格下调仍然带来了明显的成本节省。Artificial Analysis测算,缓存读取降价平均为每项任务节省约1.40美元,这一变化主要体现在智能体测试中,因为这类任务会反复读取此前已经处理过的上下文。

    如果将推理强度从最高档调整到xhigh,Fable 5.1的Intelligence Index得分为65,单项任务成本降至2.72美元,比最高强度低1.04美元。不过,这一成本仍高于Opus 5在最高推理强度下2.34美元的水平。

    因此,Fable 5.1的成本变化并不是简单的“价格下降”。Anthropic降低了缓存读取这一项费用,但模型在复杂任务中消耗的输出Token更多,最终每项任务的成本还取决于具体的调用方式和推理强度。

    此外,Fable 5.1还支持批量处理。对于异步任务,输入和输出价格可以降至每百万token 5美元和25美元。美国境内专用推理的价格系数为1.1倍,网页搜索价格为每1000次10美元,网页抓取不单独收费。

    myEB5b034rSya3qWRrIdTGNY5Muu2ngfSW7p3KGT.jpeg

    Anthropic也给出了不同模型之间的价格对比。Opus 5的输入和输出价格分别为5美元和25美元,缓存读取为0.50美元;Sonnet 5则分别为2美元、10美元和0.20美元。

    Fable 5.1的普通输入和输出价格仍高于这两款模型,但缓存读取价格已经低于Opus 5,仅比Sonnet 5高0.05美元。

    jinse.com.cn 0
    好文章,需要你的鼓励
    jinse.com.cn 0
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 腾讯科技 > Fable 5.1来了 号称全球最强 Anthropic也开始卷“缓存价格”
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部