免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    DeepSeek-V4-Flash到底震撼在哪里

    作者:硅谷Alan Walker

    bZibNOBCSMxFegv0RxvM5dEnpTs3TxbVd8Ok3Kk0.jpeg

    一次没开发布会的更新,四天之内让它成为全球调用量第一的模型。震撼的落点不在于便宜 —— 而在于它同时推翻了三条这个行业信了三年的规矩。

    先说清楚:发生了什么,全网在震撼什么

    2026 年 7 月 31 日下午,DeepSeek 在 API 文档的更新日志里加了一行字:DeepSeek-V4-Flash 正式版上线公测。没有发布会,没有预告,没有宣传视频。App 和网页端一个字没改,普通用户那天打开 DeepSeek,体验和前一天完全一样。

    nApSdjJjM40vZU50zElPQ80cPo4VtVQ5edU2M1RS.jpeg

    先把这个模型是什么讲明白。它属于 DeepSeek 今年 4 月 24 日发布的 V4 系列,这个系列一次出两款:旗舰 V4-Pro,1.6 万亿总参数、490 亿激活;轻量版 V4-Flash,2840 亿总参数、130 亿激活所谓「激活参数」,是 MoE(混合专家)架构特有的概念——模型总共存了 2840 亿个参数,但处理每一个字时只唤醒其中 130 亿个来干活。总参数决定它「知道多少」,激活参数决定它「每写一个字要烧多少电」。这个区别,是后面所有故事的起点。

    两款都支持 100 万 token 上下文(约等于一次读完一部《三体》全集)、最大输出 384K、MIT 许可证(可商用、可自己下载部署)。

    7 月 31 日这次更新,官方原话是:型结构和尺寸跟 4 月的预览版完全一样,只是把后训练重新做了一遍价格分毫未动。

    然后,四天之内,它成了 OpenRouter 全球调用量第一的模型。X、Reddit 的 r/LocalLLaMA、Hacker News 同时炸开。一位前微软工程师、开源贡献者 Andrew Zhu 在 8 月 1 日写下的第一句话,大概能代表当时的集体情绪:昨天,这个模型还是「一般般」。今天,它是 Opus 级的智能,配 Flash 级的价格。

    他坦白说,V4-Flash 刚出来时他压根没在意,觉得跟 Qwen3.6-27B 一个档次,不值得他半夜十点爬起来重新整理服务器机架去下权重。然后 0731 版本出来了 —— 同一个架构、同样 2840 亿参数 130 亿激活,只是完全重做了后训练 —— 这个模型突然坐到了 Claude Opus 4.6 在 Agent 基准上的位置,几乎全面压过 GLM 5.2。他写道:本地 AI 社区在几小时之内集体失控。— Andrew Zhu(前微软,开源贡献者),《关于 DeepSeek V4 Flash 0731 我目前知道的一切》

    所以「震撼」到底震撼在哪?下面是七条,每一条我都会先给数据,再用大白话解释它凭什么让人失控,并且尽量引一句当事人自己说的话。

    震撼一:便宜三成叫促销,便宜一百倍叫改朝换代

    先看标价:输入 $0.14、输出 $0.28(每百万 token)。这个数字本身不算稀奇,市面上便宜的模型多的是。

    真正的杀伤力在第三方独立测评机构 Artificial Analysis 那张表上。它不比单价,它比「跑完一整套标准任务,前后总共花了多少钱」。为什么这个口径更诚实?因为一个模型可能单价极低但笨,同一件事要绕十步才做对,token 烧得更多,最后账单反而更高。单价便宜不等于总价便宜。

    bplxbz04cG8jTlDsTcggIH5JN0aD5PN7pXXmaxc8.jpeg

    震撼在哪:把这张表念成人话 —— 你让 V4-Flash 干一件事,付 3 美分;让 Claude Fable 5 干同一件事,付 3 块 1 毛 5。一百零五倍。而两者的智力差距是多少?9 分。

    换个更能体会的比方:以前你叫一个顶级顾问来做事,一小时 3000 块;现在有个人开价 28 块,活儿干得没那么完美,但九成场景够用。你会不会犹豫?这就是过去这一周里,全球几十万开发者同时在做的算术题。

    还有一个更隐蔽、但对做 Agent 的人更致命的数字:缓存命中价 $0.003,比它自己的输入价低 98%,全球第一。Agent 干活是一轮一轮来的,每一轮都要把之前的全部上下文重新读一遍。如果这部分不打折,长任务的账单会滚雪球。DeepSeek 把 Agent 最大的一笔隐性开销直接抹平了。

    还有一层它自己都控制不了的价格:因为权重 MIT 开源,OpenRouter 上有 20 家供应商托管同一个模型互相压价,价格被压到 $0.088 / $0.176 —— 比 DeepSeek 官方还便宜

    这些数字落到真实开发者身上是什么样子:一整天都在用 DeepSeek-V4-Flash 0731 跑多小时的高难度任务,最后一共花了 $0.31。上一周用 Kimi K3 和同价位模型做类似的事,花了 $35……剧透一下:贵的那些,并没有好一百倍。— @tonbistudio

    Tycoon 创始人 Xiaoyin Qu 直接下了个判断:V4-Flash 会取代 Claude 成为市场份额第一,这是 2026 年最大的故事。三个理由 —— 单 token 便宜 100 倍;比 Claude 快得多;缓存效率极高。他的原话大意是:一个便宜几百倍、每个任务还快两三倍的东西,凭什么赢不了?— @quxiaoyin

    另一位用户的评论更冲:竞争是健康的,看看 Anthropic 会怎么回应 —— 先是被 Codex 压了一整周,现在又被成本只有百分之一的 DeepSeek 压。他们现在看起来像是卖着菲亚特、却收着法拉利价钱的销售。— @FoxRick01

    海外社媒把这轮情绪概括成一句话:法拉利的性能,自行车的价格还有人写「他们才是真正的 OpenAI」。有开发者起哄说马斯克应该亲自试试 V4-Flash,「像变魔术一样」—— 然后大家发现,马斯克真的关注了 DeepSeek 的官方账号。

    9 分的能力差,换 105 倍的成本差。这个比例一旦被算明白,任何关于「我们的模型更聪明」的说辞,都会先被扔进计算器里过一遍。

    震撼二:小的打赢了大的,而且是自家的大的

    价格只是入场券。让技术圈真正失控的是另一件事。

    DeepSeek 公布了九项 Agent 基准的成绩,130 亿激活的 Flash,在全部九项上超过了自家 490 亿激活的 V4-Pro 预览版

    mKIXkfs2AaajjgcdhieHGcMpAFxeGXE9kVjsSvv6.jpeg

    震撼在哪:过去三年,这个行业信的是一条朴素规律 —— 参数越多越聪明所以大家一路把模型堆到万亿、两万亿、三万亿,融资也按这个逻辑估值。

    结果 DeepSeek 用自己家的两个型号,在同一天,把这条规律推翻了一半不是别人家的小模型赢了自家大模型(那还能说是评测口径问题),是同一家公司、同一套评测、同一份技术报告里,小的赢了大的。

    更要命的是:它不是靠加参数换来的。官方明说结构和尺寸一个字没改,只重做了后训练同一具身体,换了一套教法,成绩从中游跳到顶部。

    这对整个行业意味着什么?意味着「谁能拿到更多卡、堆更多参数」这条估值主线,第一次被公开证明不是唯一解,甚至可能不是最划算的解这也是为什么在 X 和 Reddit 上,震动最大的不是普通用户,而是那些自己训过模型的人。

    另一个藏在 Hugging Face 模型卡里的细节:这个版本自带一个投机解码模块这解释了它为什么能同时做到便宜和快 —— 每秒输出 122.7 个 token,首字延迟 1.34 秒,在同量级开源模型里都属于上游。Hacker News 上有人把这件事算得很直白:

    OpenAI 的 Luna 是 DeepSeek Flash 的 2 到 3 倍价格,你换来的是 2 到 5 倍更快的推理。」另一位跟帖把两家的价目表并排贴出来后总结:在这个价位上,选 Luna 还是选 Flash,你都不会错。— 用户 spwa4 等,Hacker News 讨论串

    同一个模型,同一天,前一天还是「还行」,后一天变成「Opus 级」。变的不是它有多大,而是它被怎么教的。

    震撼三:秘密武器不是芯片,是一套换掉的教学法

    这是全篇最值得慢读的一段。因为它回答了所有人都在问的那句:凭什么?

    底料:32 万亿 token,而且专门躲开了「AI 写的垃圾」

    V4-Flash 预训练用了 超过 32 万亿 token,Pro 用了 33 万亿;上一代 V3.2 只有 14.8 万亿,翻了一倍多。技术报告里还写了一个很少人注意的处理:专门过滤掉网页上那些 AI 批量生成的、模板化的内容,为的是避免模型「吃自己的排泄物」导致能力退化。

    震撼在哪:2026 年了,互联网上有多少文字是机器写的,大家心里有数。别家还在拼数据量,DeepSeek 已经在拼数据的干净程度这是一个只有真正吃过亏的团队才会优先解决的问题。

    省钱术:把「读一百万字」的电费砍到四分之一

    Transformer 有个先天毛病:上下文每翻一倍,注意力的计算量翻四倍。所以百万 token 上下文过去是个奢侈品 —— 能印在参数表上,但没人敢真用,因为烧钱。

    V4 上了一套混合注意力,两种机制交替叠加:CSA(压缩稀疏注意力,先把缓存压小,再只挑最相关的几块算)和 HCA(重度压缩注意力,把远处的历史信息进一步狠压)。效果是:在 100 万 token 场景下,单 token 推理算力降到 V3.2 的 27%,显存里的 KV 缓存降到 10%;Flash 版更极端,做到 10% 和 7%

    震撼在哪:同样读一本一百万字的书,V4 的电费只有上一代的四分之一,占的显存只有十分之一。百万上下文从「展示柜里的样品」变成了「每天都能用的日用品」。这也是它敢把缓存价定到 $0.003 的底气 —— 它的成本结构真的允许。

    发动机:换掉了行业标配

    另外几个不直观但很硬的改动:用Muon 优化器替掉了行业标配的AdamW(收敛更快、训练更稳);用mHC(流形约束超连接)改造残差连接 —— 把跨层传信号的映射矩阵约束在一个叫 Birkhoff 多面体的数学结构上,代价几乎为零,但深层网络的信号不容易失真;再加上 FP4 量化训练,把每个数字占的位数压到 4 位。

    震撼在哪:这三样合起来是一句话 —— 同样的芯片、同样的电,多榨出一大截有效算力。在美国限制高端芯片出口的背景下,这不是锦上添花,是生死线上的功夫。

    真正的答案:OPD

    前面几件都是省钱的。这一件是提分的,也是「以小博大」的全部秘密。

    行业主流的后训练做法叫混合强化学习(mixed RL):把数学、代码、Agent、指令跟随一堆目标混在一起同时强化。问题是这些目标的梯度方向经常互相打架,数学练上去了代码掉下来,业内管这叫「跷跷板效应」。

    DeepSeek V4 的选择很决绝:把混合强化学习这个阶段整个删掉,换成 OPD(On-Policy Distillation,同策略蒸馏)技术报告里的措辞就是「完全替代」。

    流程分两步,用一个学校的比方讲:

    第一步:分科集训,先培养十几个偏科状元

    从预训练好的基座出发,按领域分别训练 十几个专家模型—— 数学一个、代码一个、Agent 一个、指令跟随一个……每个都走完整的 SFT + GRPO 强化流程,在自己那一科里练到极致。

    因为是分开练的,梯度不会互相干扰。数学专家可以毫无顾忌地往数学方向猛冲,不用担心把代码能力带崩。

    第二步:边做边批,让学生自己答题,状元逐字批改

    关键在这里。传统蒸馏是「老师写一份标准答案,学生抄」—— 学生学的是老师的语气,一旦自己下笔就露怯,因为它从没在自己的思路上被纠正过。

    OPD 反过来:让学生(统一模型)自己先把答案写出来,然后十几个专家在学生自己写的这条轨迹上,逐个 token 打分纠偏数学题就向数学专家对齐,编程题就向代码专家对齐。

    学生永远在 自己会犯的错上被纠正,而不是在老师的完美答案上做阅读理解。这就是「on-policy」四个字的全部含义。

    DeepSeek 还加了一层狠的:全词表蒸馏别家为了省算力,通常只在每个位置估一个近似值;V4 保留完整的概率分布来算反向 KL,梯度更稳,也更忠实地把每个专家的细微手感传给学生。代价是计算量暴涨——所以它专门建了一套基础设施来扛:十几个万亿参数级别的教师模型,权重根本塞不进显存,全部卸载到分布式存储里,用类 ZeRO 的分片机制按需加载,每个 mini-batch 每个教师只加载一次。

    震撼在哪:别人是拿一个大模型蒸一个小模型。DeepSeek 是 拿十几个万亿参数的偏科天才,围着一个 130 亿激活的学生,一个字一个字改作业

    而且这条路便宜得离谱。阿里 Qwen3 的技术报告早给过数字:蒸馏用 约十分之一的 GPU 算力,能达到强化学习同等效果,探索空间还更广。GLM-5、小米 MiMo 也都在用。V4 的不同在于 —— 别人把 OPD 当辅助环节,DeepSeek 把它当成了后训练的主干道。

    再回头看那个「130 亿打赢 490 亿」的结果就不神秘了:Pro 预览版是老方法练的,Flash 正式版是新方法练的。教学法的代差,覆盖掉了参数量的代差。

    顺便说一句,这份技术报告的坦诚程度也让很多人意外。它如实写了:某些对手的成绩栏是空的,因为对方 API 太忙调不通;也直接承认自己对比 GPT-5.4 和 Gemini-3.1-Pro仍有三到六个月的差距不吹不掩,这在 2026 年的模型发布稿里已经很少见了。

    震撼四:它没造 Codex 的竞品,它成了 Codex 里的一个选项

    如果只看到降价,那就漏掉了这次发布里最有战略含量的一行字:正式版原生支持 Responses API 格式,并且专门针对 Codex 做了适配。

    Responses API 是 OpenAI 定义的接口格式,Codex 是 OpenAI 的编程 Agent 产品。DeepSeek 的做法不是造一个竞品去正面抢用户,而是把自己做成 Codex 里可以直接选的那个引擎

    震撼在哪:做过 ToB 生意的人都知道,用户换供应商最大的成本从来不是价格差,是 迁移成本—— 工具要换、习惯要改、代码要重写、团队要重新培训。这层摩擦力,是所有付费产品真正的安全垫。

    DeepSeek 这一手,把这层摩擦力抹到接近零:工具不用换、习惯不用改、代码不用动,连中间那层格式转换的垫片都可以扔掉。只把模型名字这个字符串换掉,账单降九成。

    迁移成本降到零的那一刻,「用户忠诚度」这个词就失效了。

    同样值得注意的是它的产品排布:DeepSeek 明明有个更强的 Pro,却把 Agent 能力堆在便宜的 Flash 上。定位写得明明白白 —— Flash 不是「Pro 太贵时的备胎」,它就是 Agent 的默认选项。

    震撼五:这不是社媒情绪,是一本可以查的账

    社交媒体上的惊叹可以是泡沫。但 OpenRouter 是全球最大的多模型聚合平台,开发者在上面调什么模型,是按 token 数直接公开可查的 —— 这是目前最诚实的一块记分牌,因为每一次调用背后都是有人在真金白银付钱。

    JxNN1N97UZTihwXgfXOLpn2gmETmo7KmZMOwL2rI.jpeg

    前五名,五个都是中国模型。全球该周总调用量约 56.8 万亿 token中国模型合计已经连续 14 周超过美国模型总和,7 月底在该平台占比达到 66.5%

    更要命的一个数字是流量来源:访问中接近一半来自美国和欧洲的开发者

    震撼在哪:这不是国内自己人捧场,是硅谷自己的创业公司在用中国模型而且它发生得极快 —— V4-Flash 正式版 7 月 31 日上线,四天后登顶。

    对照一下:Kimi K3 的智力指数比它高 7 分,同一周从前列直接掉到第 12 名。能力更强的那个,输给了算得过账的那个。

    迁移的实际效果

    OpenCode CEO Jay 在 8 月 1 日发文:V4-Flash 上线后平台单日用量增长 30%,新订阅用户同样增长 30%。

    Lindy AI(旧金山)用了 Anthropic 六周后转投 DeepSeek,成本降到原来的十分之一,一年省下数百万美元。

    多家海外 AI 初创 在 X 上公开复盘:全线迁移后月度推理成本下降 60% 到 85%。

    Airbnb / Pinterest / 微软 都在不同程度上用中国开源模型处理常规编码与自动化任务。

    对一家还没盈利、现金流紧绷的小公司来说,60% 到 85% 不是「优化了一下成本」,是 这个项目今年能不能活下去这就是为什么社媒上的情绪那么激烈 —— 那不是技术爱好者的兴奋,是一群人发现自己的公司刚刚多活了一年。

    震撼六:三家对手挨的打,落在完全不同的位置

    一个模型能不能算「震撼」,看对手的动作最准。这次三家的反应,方向完全不同。

    OpenAI提前一天出手:降价 80%,但必须包装成技术故事

    7 月 30 日 —— V4-Flash 正式版上线的 前一天 —— OpenAI 把 GPT-5.6 Luna 的 API 价格砍了 80%,从合计 7 美元降到 $0.20 / $1.20;中端的 Terra 降 20%,到 $2 / $12。

    官方说法不是「我们被逼降价」,而是「我们用最强的 Sol 重写了自己的推理基础设施,端到端服务成本降了 20%,token 生成吞吐提升 15% 以上」。体面保住了。

    震撼点在这里:Luna 的智力指数是 51,只比 Flash 高 1 分,降完价仍贵约 3 倍。这是一次防守性降价,而且降完还没站到线的正确一侧。

    Anthropic站着不动:它是唯一没降的,甚至还在涨

    Fable 5 维持 $10 / $50,Opus 5 维持合计 30 美元(用能力提升代替降价),Sonnet 5 的优惠价 $2 / $10 将在 8 月 31 日涨到 $3 / $15

    底气来自收入结构:约 80% 收入来自企业客户,年费超百万美元的客户从 2 月的 500 家涨到 4 月的 1000 家以上,财富 10 强里 8 家在用,Claude Code 单品年化 25 亿美元。

    震撼点在这里:这批客户买的不是 token 单价,是合规、稳定性和已经嵌进内部系统的工作流。低价砍得动中小开发者,砍不动签了三年框架协议的大企业但 Lindy AI 那种案例说明,中间那一层正在漏水。

    月之暗面位置最尴尬:估值三个月涨近三倍,调用量掉出前十

    Kimi K3 是全球首个落地的 3 万亿参数级开源模型,智力指数 57,V4-Flash 高整整 7 分,7 月中还在 Arena 前端编程榜上拿过第一。技术上它是赢的。有实测拿 K3 官方的赛博朋克、3D 打字机、黑洞等复杂前端案例做对比,结论是 Flash 基本能满足要求,但细节实现确实不能和 K3 相提并论—— 只是每个任务的花费几乎都在 1 元以内。

    但 API 定价 $3 / $15 —— 输出价是 Flash 的 五十三倍结果是上周 OpenRouter 排名从前列直接掉到第 12。

    震撼点在这里:它刚启动 Pre-IPO 轮,估值 500 亿美元(上一轮 350 亿,4 月还只有 180 亿)。一边是调用量在掉,一边是估值三个月涨了近三倍。

    三家的差别可以归成一句:OpenAI 被打在价格上,Anthropic 被打在中间层客户上,月之暗面被打在单位经济学 —— 第三种最难治,因为 3 万亿参数的推理成本结构,决定了它就算想降也降不动。

    震撼七:最震撼的地方,同时也是最脆弱的地方

    把上面六条串起来,会发现一个反常识的事实:让 DeepSeek 震撼世界的每一样东西,恰好也是它最难变现的东西这一节泼冷水。

    一、开源正在吃掉它自己的账单

    V4 上线当天,国内 8 家芯片厂商完成适配,FlagOS 社区直接上线一键部署。这意味着企业可以自己把模型部署起来跑业务,完全不用接 DeepSeek 的 API,一分钱不付有金融投研平台的创始人在采访里说得很直接:模型没开源之前他们按调用量付费用 API,开源之后直接自主部署,不再付费。

    震撼的另一面:开源给 DeepSeek 换来了全球口碑和生态,代价是 —— 最有能力付钱的那批客户,恰好也是最有能力自己部署的那批。调用量第一,不等于收入第一。

    二、那个 545% 的利润率是过期数据

    2025 年开源周最后一天,DeepSeek 主动公开过推理成本:V3 和 R1 的推理服务平均占用 226.75 个节点,每节点 8 张 H800,日运营成本约 8.7 万美元,若全按 R1 定价收费理论日收入 56.2 万美元,成本利润率 545%。

    这组数字被引用了一年多。但它是 H800 集群上的账。V4 已经迁到华为昇腾平台,新的成本结构官方从未公开过。任何今天还拿 545% 说事的人,用的是一份过期财报。

    三、成绩单是自己判的,而且它很啰嗦

    那九项 Agent 基准,全部来自 DeepSeek 自家的 Harness 评测框架(minimal 模式、max 推理档、top_p 0.95、temperature 1.0),截至发布时没有第三方独立复现其中 DSBench-FullStack 和 DSBench-Hard 干脆是内部测试集,没有横向可比性。

    Artificial Analysis 那边暴露了另一个问题:跑完一遍智力指数,它烧掉 2.1 亿输出 token,是中位数 1 亿的两倍多。单价便宜,会被更长的思考轨迹吃掉一部分。

    还有开发者实测发现,同一任务在 DeepSeek 高推理档下跑了 2 小时,而 Codex 5.5 中档只要 20 分钟。速度快是指出 token 的速度快,不代表把活儿干完的时间短。

    另外三条短板一并列出:没有原生多模态(图文混合场景要另找模型);超复杂多步 Agent 和高精数理仍弱于 Pro;V4-Pro 正式版跳票了—— 原定 7 月中旬发布,结果 7 月 31 日只出了 Flash,Pro 至今没有公测时间表。有接近 DeepSeek 的投资人在 7 月下旬说,近期训练新模型的压力并不小。

    接下来三个月:五个能被证伪的判断,以及对手会怎么接招

    预测如果不带时间窗和证伪条件,那就只是表态。下面每一条都写清楚:什么时候见分晓,什么信号出现算我说错。

    判断一:DeepSeek

    预测:Q4 之前 V4-Pro 正式版发布,并伴随 ≥50% 的降价;同期推出自家的开源 Agent 框架,对标 Codex。

    依据:官方已明说:下半年昇腾 950 超节点批量上市后,Pro 价格会大幅下调。昇腾 950PR 用中芯 7nm,FP8 算力 1 PFLOPS、FP4 2 PFLOPS,是 H20 的 2.87 倍,自研 HiBL 1.0 显存 112GB、带宽 1.4TB/s。产能上来,Pro 的吞吐瓶颈就解了。

    证伪:若到 10 月底 Pro 仍未正式发布、也无官方 Agent 框架,说明算力与训练压力远超外界估计,5000 亿估值的故事会先出现裂缝。

    判断二:Anthropic(8 月 31 日见分晓)

    观察点:Sonnet 5 的优惠价 $2 / $10 将于 8 月 31 日到期,涨到 $3 / $15。

    它会怎么接招:按期涨价,但同时在低价档补一枪 —— 要么更新 Haiku 线,要么把已经上线的可调推理强度做成显性的低价档位,用「同一个模型、你自己选花多少钱」来接住中小开发者。它不会正面打价格战,那会动摇它对企业客户的定价叙事。

    读法:按期涨且无低价动作 = 彻底放弃普惠开发者市场,全押高价值企业;推迟或取消涨价 = 低价冲击已经烧到它的中间层。这是全行业最干净的一次公开实验,25 天后自动揭晓。

    判断三:OpenAI

    处境:它刚用 Codex 生态把开发者拢住,DeepSeek 转身就适配了 Codex。价格这条路,Luna 已经降到 $0.20 / $1.20,再降就得动毛利。

    它会怎么接招:大概率不再降单价,走三条里的一条或多条:(1)在 Codex 里加接入限制,让第三方模型不能当默认引擎 —— 今年 1 月 Anthropic 就干过一次,批量切断 Claude Code 的外部调用,Cursor 和 OpenCode 集体报错;(2)用包月订阅把开发者从按量计费里拽出来,让价格不可比;(3)继续用「我们的模型自己优化了推理栈」这套叙事,把下一次降价再包装成技术进步。

    证伪:若 9 月底前 OpenAI 又来一次 50% 以上的公开降价,说明它判断守生态守不住,只能守价格 —— 那对全行业毛利是更坏的消息。

    判断四:月之暗面

    处境:3 万亿参数的推理成本结构决定了它降不动价。K3 的能力是真的,账单也是真的。

    它会怎么接招:不打价格战,走「不靠 token 量」的三条路:私有化部署与端侧授权(一次性收费,绕开单价对比)、用 Arena 前端编程第一这类能力叙事守住愿意付溢价的高端客户、以及在 Pre-IPO 交割前把资本故事讲完。

    证伪:若 9 月前 K3 宣布 50% 以上降价,说明调用量下滑的压力已经压过了毛利考量 —— 也意味着它承认单位经济学这一仗输了。

    判断五:谷歌与第三条路

    观察:谷歌没跟着砍单价,它在砍用量:Gemini 3.6 Flash 在同一套评测里比 3.5 Flash 少烧 17% 的输出 token,某些长链条工程任务上省到 65%。

    预测:这会成为主流对手的标准答案 —— 不比谁单价低,比谁把同一件事做完用的 token 少。因为单价可以被开源模型无限逼近到零,token 效率不能。

    对 DeepSeek 的含义:这反而是个隐患:它现在正是那个「很啰嗦」的模型(2.1 亿 vs 中位数 1 亿)。如果对手把「每任务 token 数」这个指标打出来,它 105 倍的优势会被压缩到几十倍。

    震撼的真正落点:一把尺子被换掉了

    回到标题那个问题。把七条压成一个公式,是这样的:

    一次有效任务的成本 =(激活参数 × 每任务 token 数)× 单 token 算力单价 ÷ 一次做对的概率

    过去两年,所有人都在优化最后那一项 —— 想办法把正确率往上推,为此不惜把参数堆到万亿。DeepSeek 同时压了前面三项:激活参数从 490 亿降到 130 亿,投机解码模块压缩解码开销,混合注意力把长上下文的算力和显存砍到零头,缓存命中把重复读取的价格抹掉 98%。

    分子降了两个数量级,分母只掉了 15%。

    所以,DeepSeek-V4-Flash 到底震撼在哪里?不在于它便宜,也不在于它强,而在于它让所有人重新学会了一种算账方式

    一年前,行业比的是 MMLU 和 SWE-Bench 上谁的分数高,发布会上全是柱状图。今天,X 上转发量最高的那条帖子,内容是一张 $0.31 的账单截图。

    当买家换掉了尺子,卖家就再也回不到旧的价目表了。

    8 月 31 日,Anthropic 那个涨价日,会是这把新尺子的第一次公开验票。

    jinse.com.cn 0
    好文章,需要你的鼓励
    jinse.com.cn 0
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 嘉妍Kea > DeepSeek-V4-Flash到底震撼在哪里
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部