免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    谷歌连发三款“Lite、Flash”模型 但最强Pro再次缺席

    DmOv1RrJhn7SFH1nhrJHmaUYoZfIPEorm05Nu7Yv.jpeg

    作者:晓静,腾讯科技

    美国当地时间7月21日,谷歌DeepMind团队一口气放出三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。

    其中,主力模型Gemini 3.6 Flash在编码和多模态任务上表现更强,但更关键的是,它处理相同工作所消耗的输出token比前代减少了17%到65%。

    Gemini 3.5 Flash-Lite主打极致的速度与性价比,每秒可生成350个输出token。

    而Gemini 3.5 Flash Cyber则是一款针对网络安全漏洞检测与修复进行微调的专用模型,目前仅向政府和特定合作伙伴开放。

    aTwYvnvPn4cl5LfNFEPaEhDcK2HbcJuMTrRaBDqt.jpeg

    与此同时,外界期待已久的旗舰模型Gemini 3.5 Pro依然没有露面,谷歌表示它正在与合作伙伴进行测试,并首次透露,更庞大的Gemini 4预训练工作已经启动。

    告别“啰嗦”的AI

    在大语言模型的应用成本中,输出token的数量直接关联到费用与延迟。Gemini 3.6 Flash的设计目标之一,就是降低这种不必要的消耗,同时保持或增强任务完成的质量。

    第三方基准测试机构Artificial Analysis Index的实测显示,该模型输出token使用量较前代降低了17%。在需要多步骤推理和工具调用的复杂工程任务中,节省效果更为明显。

    xwf6xVCphLPDws47oFJ4xuWOoMdizAexFgE1EL5v.jpeg

    例如在Datacurve的DeepSWE基准测试中,token消耗减少了65%,这意味着Gemini 3.6 Flash在完成任务时执行了更少的冗余代码编辑和循环操作。

    7TOI6OcqsTYx6fMfwZz7ww7HDIJwefQejZai7Z8v.jpeg

    这种效率提升还带来了直接的价格下降。

    Gemini 3.6 Flash定价为每百万输入token 1.50美元,每百万输出token 7.50美元。相较于3.5 Flash每百万输出token 9美元的价格,单次智能体任务的总成本有所降低。

    kk9gThMdu21afcJXp2gszTsk77ezWWflMn5leDlu.jpeg

    性能方面,Gemini 3.6 Flash在多个基准测试中取得了可量化的提升。

    DeepSWE测试中得分为49%,高于3.5 Flash的37%。MLE-Bench机器学习工程基准测试中,得分从49.7%提升至63.9%。

    j1eRWG5ie2PATUlDa2yYUBT99IzH6zg0RfC46YPG.jpeg

    计算机使用能力在OSWorld-Verified测试中得分为83%,此前为78.4%,该功能现已成为Gemini API和Gemini Enterprise的内置客户端工具。

    知识工作方面,GDPval-AA v2基准上的得分从1349提升至1421。

    多家客户已经给出反馈。

    Figma、Harvey、Hebbia和JetBrains均表示,Gemini 3.6 Flash在处理复杂工作流和知识型任务时,在token效率、准确性和速度之间取得了平衡。

    谷歌展示了Gemini 3.6 Flash在几个实际场景中的表现。

    在金融领域,该模型使用AI Studio上的Managed Agents,能够比Gemini 3.5 Flash更高效、更准确地解析和分析财务数据及记录。

    VKR1SlQU2aFpEMQHsXpBqwijNUOo9eS4lHzjWpM7.jpeg

    在代码迁移任务中,Gemini 3.6 Flash在Antigravity平台上借助多智能体编排执行操作,比前代具有更低的延迟和更高的质量。

    W1Dpv0QiOEVGe2LI1NxDvDNSjsJ8UNYGnFnioGlY.jpeg

    在创意工具方面,Gemini 3.6 Flash利用视觉理解能力,通过Antigravity和tldraw开源绘图工具构建了一个交互式主题工作室。

    PHccz8pvkMw6Eey3r4wxP2obWVAyHgivpRHNSDAR.jpeg

    此外,该模型还使用Gemini App中的画布功能,帮助开发者制作了一个用于3D工作流的摄影纹理提取器。

    YQfKBBXPEawSPPDyy3wdYRuvadVAMg7eHB4xbtCe.jpeg

    在速度上卷出新高度

    Gemini 3.6 Flash追求的是效率平衡,Gemini 3.5 Flash-Lite追求的则是速度极限。

    谷歌将其定义为3.5系列中“最快、最具成本效益”的模型。根据Artificial Analysis的实测,它的生成速度达到每秒350个输出token,这大约是上一代3.1 Flash-Lite速度的两倍。

    定价也极具竞争力,每百万输入token 0.30美元,输出token 2.50美元。这种低成本和高速度,瞄准的是高吞吐量的业务场景,例如智能体搜索、大规模文档处理等。

    虽然名字中带有Lite,但Gemini 3.5 Flash-Lite在SWE-Bench Pro测试中,得分54.2%,超过了标准版Gemini 3 Flash的49.6%。在OSWorld-Verified测试中,它以74%的成绩优于Gemini 3 Flash的65.1%。

    7tahS6SSCZwx7nAJ2IiPnqWCo58Pzvfmcb2zzuI6.jpeg

    IENk8R7au9bidNV4fGXnTW2FcBjalIpNwZRnwRVT.jpeg

    开发者还能根据工作负载调整模型的“思考层级”:处理简单的高容量任务时,可设为最低思考以换取低延迟和低成本;面对复杂子智能体任务时,再提高思考层级保证质量。

    谷歌公布了Gemini 3.5 Flash-Lite在四个场景中的演示案例。

    第一个是从海量电子商务数据集中提取产品特征并进行整合。

    第二个是作为主智能体与Gemini 3.5 Flash-Lite协同工作,即时生成25个独特的、可随时探索的网页设计概念。

    第三个是利用多模态理解能力,大规模进行收据翻译和摘要。

    第四个是通过即时生成并迭代多个选项来构建游戏。

    早期客户Ashler、Paloalto和Ramp均强调了该模型在速度、智能和成本效益方面的独特组合,认为其适用于扩展智能体工作流和数据处理任务。

    “白帽黑客”专用模型

    谷歌发布的第三款模型Gemini 3.5 Flash Cyber,是专门用来发现和修补网络安全漏洞的。

    这款模型基于Gemini 3.5 Flash进行微调,谷歌希望它能以更低的token成本,去完成那些通常交给大模型的代码安全任务。在名为CyberGym的基准测试中,它的表现已经达到了前沿水平。

    d6VUg5SflE5JjqeEwFUcaIrJzj8HoJtiu29RA6OS.jpeg

    不过,鉴于网络攻防的双刃剑性质,谷歌对这款模型采取了审慎的交付策略。它不会面向所有开发者开放,而是直接集成到谷歌的代码安全智能体CodeMender中,作为一个有限访问试点项目,仅独家提供给政府和受信任的合作伙伴。

    谷歌Gemini团队产品管理高级总监图尔西·多希表示,这是为了让一线的防御者能在关键漏洞被广泛利用前,抢先一步发现并修复它们,降低被滥用的风险。

    谷歌透露,在内部测试中,这个模型在开源代码库V8 JavaScript Engine中找出了55个问题,其中10个漏洞是其他模型未能发现的。

    从三款新模型的布局能看出,谷歌当前的策略是在效率上建立优势。

    当下,越来越多的企业开始审视AI投入产出比,意识到大量消耗token并不总能换来好结果。谷歌CEO桑达尔·皮查伊在今年早些时候就提过,有的公司5月份就花完了全年的token预算,如果能混合使用Flash模型和其他前沿模型,能节省大量资金。

    这种思路反映在产品上,就是不断压低成本、提高速度,同时增强模型处理具体任务的能力。

    伴随这些高性能指标,安全也是必须要做的功课。Gemini 3.6 Flash在化学、生物、放射性、核(CBRN)以及网络攻击滥用方面,都加强了前沿安全防护,提升了抵御越狱攻击的能力,同时尽量减少对正常有益用途的拒绝。

    对于普通用户和开发者,这些模型自发布当天就可以在Google AI Studio、Android Studio和Gemini应用里用到,同时可在Google Antigravity及Gemini Enterprise应用中使用。

    Gemini 3.5 Flash-Lite还会逐步在谷歌搜索引擎中推开。Gemini 3.5 Flash Cyber,将通过CodeMender以邀请制落地。

    3.5 Pro仍在测试,Gemini 4已在路上

    尽管Flash模型陆续到位,但开发者社区更关心的问题始终是:Gemini 3.5 Pro何时发布?

    谷歌上一次更新Pro系列模型是在今年2月发布的Gemini 3.1 Pro。此后,竞争对手的旗舰产品持续迭代。

    OpenAI先后发布了GPT-5.5并开始推出GPT-5.6,Anthropic推出了Claude Opus 4.8和Claude Sonnet 5,并扩大了前沿模型Fable 5的访问权限。

    今年5月,谷歌在发布Gemini 3.5 Flash时曾预告Pro版本已在内部使用,预期一个月内推出。如今已至7月末,该模型仍处于未公开状态。彭博社此前报道称,谷歌因难以达到内部性能目标,在推出3.5 Pro方面面临内部延迟。

    对此,谷歌DeepMind技术负责人洛根·基尔帕特里克在社交媒体上回应说,Gemini 3.5 Pro正在与合作伙伴进行测试,计划在准备就绪后立即广泛提供。但他没有给出具体的时间节点。

    iOk0c88qHwF0rL9eGybBi6JP1790zyZoEKVPbWfU.jpeg

    谷歌方面并未详细解释延期原因,但在公布Flash系列的同时,首次正式提及了下一代旗舰模型Gemini 4的进展。团队表示,已经启动了Gemini 4的预训练工作,并称其为“迄今为止最雄心勃勃的预训练工作”。

    这在一定程度上表明,谷歌的模型研发管线仍在持续推进,而3.5 Pro的交付节奏可能受内部测试和性能目标的影响。

    美国网络科技媒体BI表示,截至Flash系列新模型发布当天,在Artificial Analysis的数学和推理等综合基准测试中,谷歌还没有一款模型进入该排行榜前十名。

    新模型开放访问后,开发者社区很快传出了相当数量的负面声音。这些反馈主要集中在3.6 Flash的实际表现上。

    有开发者在构建3D金门大桥场景时,反复提示了三次,模型仍持续忽略指令。最终输出质量甚至还不如5个月前发布的Gemini 3.1 Pro。

    0mWPT0muYRTMWRzS9waa9ynG63awCxDJQ9TtMz7O.jpeg

    另一位开发者在Antigravity平台上测试后反馈,木头纹理质量更差,大理石缺乏功能性,在AI游戏测试中同样失利。

    有用户给模型布置中等规模任务,两分钟就完成了,但结果被评价为“一个本地4B模型都能比它做得更好”。

    还有人将矛头指向了性价比。

    有评论指出,3.6 Flash虽然便宜,但在每个编码基准上都表现不佳。相比之下,Kimi K3和GLM 5.2等模型由资本规模远小于谷歌的实验室打造,却交出了更好的成绩。

    bmpr3r63zdj5ClBuSmQiIqqJapbaHevkCYhemOh5.jpeg

    月之暗面作为Kimi的创建者,估值约300亿美元,与谷歌约4.5万亿美元的市值相差约150倍。开发者对此表达了困惑。

    更具体的数据来自Artificial Analysis的评分。

    有用户注意到,3.6 Flash在该平台上的得分与3.5 Flash完全相同,但排在Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Claude Sonnet 5、Grok 4.5和GPT-5.6 Terra之后。

    YFrB0D6b4gAYRitZm0FwYH9nrLTdK8bPKkolGQIL.jpeg

    jinse.com.cn 0
    好文章,需要你的鼓励
    jinse.com.cn 0
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 腾讯科技 > 谷歌连发三款“Lite、Flash”模型 但最强Pro再次缺席
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部