免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    和15家硅谷AI公司聊完 我重新理解了开源与闭源之争

    作者:辰子Tina;来源:硅谷非共识

    从 Token Optimization 到 Model Routing,过去一个月我最大的几个判断。

    先说三个结论:

    1. 硅谷最火的词已经从Token Maxing变成了Value Maxing:企业第一次开始系统性地管理 AI 成本。

    2. 开源模型的token份额涨得比大多数人想象的快:某头部Coding Agent平台上,7 个月从 0.1% 涨到 15%。但 token 份额和收入份额是两回事。

    3. 一个多月前Gavin Baker给过一个框架:前沿模型拿走90%的价值,开源模型承载80%的token。用最新数据检验,token那一半兑现得比预期还快:6月初,中国模型的 token 量在 OpenRouter 上已经超过美国模型。

    昨天,Google交出了Q2财报,正好是本文一个现成的注脚——Google Cloud 收入同比增长 82% 至 248 亿美元,backlog升至5140 亿。更值得注意的一个数字:Google第一方模型 API 的吞吐量已达每分钟约220亿 token,上季度还是160亿。

    Token Optimization聊了半年,token 总量还在加速——这就是后文会讲到的 Jevons Paradox 的实时演示。但市场盘后给的反应是下跌:资本开支翻倍至 449 亿美元,上市以来首次出现单季自由现金流为负。增长没人怀疑了,市场开始给"账单"定价。


    上周在Menlo Park参加了一场闭门会,和Cursor, Fireworks, Cognition, Sierra 等十几家AI Native公司聊了两天。 加上这段时间在斯坦福,以及和创始人一对一访谈里反复讨论同一批问题,我越来越确定一件事:
    AI 的竞争,正在从Capability 转向Economics。
    过去两年讨论的是谁能训出最强的模型;今天,企业开始问的是:哪些任务值得调用最强的模型,哪些任务用便宜的模型就够了。
    对应的两个关键词,是Token Optimization和Model Routing。前者意味着企业第一次开始系统性管理 AI 成本;后者意味着企业不再依赖单一模型,而是根据任务,在闭源、开源甚至自研模型之间动态分配流量。
    硅谷关于开源模型的讨论,已经从"它够不够聪明",变成了"它能不能承担更多生产流量"。而这背后真正影响的,是 OpenAI、Anthropic 这些 Frontier Labs 未来几年的收入增长曲线。
    增长没有放缓,但增长的逻辑变了
    先纠正一个容易被误解的判断:企业开始优化 token,不等于 AI 投资降温。
    恰恰相反,这批 AI Native 公司的增速依然惊人。三个例子就够说明问题:Fireworks的ARR年初约4亿美元,现在已突破10亿,刚刚以175亿美元估值完成融资;Cognition约 5 亿美元,同比接近七倍;视频生成赛道的 Higgsfield,14 个月前收入是零,现在 5 亿美元。
    支撑增长的原因有三个:模型能力过去半年出现明显跃迁,企业真正看到了 ROI;产品从 Copilot 演进到 Agent,单个任务消耗的 token 显著增加;越来越多公司切换到 Subscription 加 Usage 的混合收费,Token Consumption 直接转化为收入。
    AI Spending 没有放缓,只是进入了精细化运营阶段:企业依然愿意花钱,但不再愿意为低价值的 token 买单。
    Token Optimization:每一次客户对话都在谈成本
    Token Optimization是这两天出现频率最高的话题。Cursor的原话是:现在每一次客户对话,都在谈这个。
    企业开始重新设计 Workflow,分析哪些任务真正需要最强模型,哪些任务可以下沉到更便宜的模型。
    但也不是所有人都在踩刹车。ClickHouse 是个有意思的反例:他们付给 Claude 的钱,今年1 月是 2 万美元/月,6 月是 100 万美元/月,涨了 50 倍,相当于自己收入的 5%。即便如此,公司依然鼓励员工放开用,预期要涨到10%,因为他们认为 AI 带来的生产力提升远高于这部分成本。
    不过纵观全场,ClickHouse 是少数派。大多数企业已经在装刹车。有公司把这轮优化潮的导火索,归结为软件厂商集体转向 token 计费——比如微软 6 月 1 日把 GitHub Copilot 改成了按 token 收费。当成本第一次变得清晰可见,管控就开始了。
    这让我想起 2022 到 2024 年的 Cloud Optimization。当时企业没有放弃云,只是在优化资源利用率——但值得记住的是,当时多头也说"优化完了会花得更多",结果是 AWS、Snowflake、Datadog 们经历了连续四个季度的增速下滑。今天优化的对象从云资源变成了 token,剧本会不会重演,是下半年最值得盯的问题之一。
    Model Routing:企业买的不再是一个模型,而是一套系统
    如果说 Token Optimization 是目标,Model Routing 就是方法。
    我们早已越过了"给用户一个模型下拉菜单"的阶段。Cognition 现在可以把一次推理任务拆成多个子任务,根据成本、推理能力、延迟和准确率,自动分配给不同的模型。用户甚至不需要知道背后调用了谁。
    企业真正采购的,不再是某一个模型,而是一套能智能调度多个模型的系统。
    去年的问题是:Who builds the best model?
    今年的问题是:Who routes to the best model?
    这个迁移有多快?两个数据点:客服 AI 公司 Decagon 披露,30% 的 token 请求已经路由给开源模型;Factory 平台上,开源模型的 token 份额去年 12 月只有 0.1%,2 月到 1%,现在是 10% 到 15%——7 个月涨了一百多倍。他们的创始人甚至认为,12 个月后可能到 90%。
    90% 我持保留意见,但方向和斜率是清楚的。而且值得注意的是,路由给开源模型不只是图便宜——好几家公司提到另一个动机:不想被任何一家模型厂商锁死。
    模型市场的哑铃结构:要么 Great,要么 Cheap
    聊完这些公司,我对模型格局的判断可以浓缩成一个词:哑铃。
    模型市场最终会形成一个哑铃结构。
    要么 Great,要么 Cheap。
    中间地带,会越来越难生存。
    两端各自都会经历整合。便宜这一端,这半年新面孔不断——Kimi K3、GLM 5.2、Qwen 轮番抢镜——但把地板价钉死的仍然是 DeepSeek:它至今是 OpenRouter 上份额最大的单一模型供应商,超过任何一家美国厂商。有投资人把它称为市场的 "price-performance floor"。
    DeepSeek 给整个市场设定了性价比的地板:任何比它贵的模型,必须显著更好,否则用户宁可用 DeepSeek 多重试几次。一个模型如果只是和它打平、或者只好一点点,会很难活下去。
    而强的这一端,真正的问题是:便宜的模型会不会跨过 "good enough" 这条线?
    Bear case 是:一旦便宜模型足够好,大多数用户就满足了,Frontier Labs 的溢价随之瓦解。
    我不同意这个判断。我认为对 frontier intelligence 的需求永远不会被彻底满足——每当模型能力上一个台阶,就会解锁一批原来做不了的任务。哑铃的两端,都会有 durable demand。


    一个多月前,Gavin Baker 给过一个框架:frontier 拿走 90% 的价值,开源承载 80% 的 token。当时我还在想,这个判断会不会很快过时——毕竟 Kimi K3、DeepSeek V4 都是之后的事。用最新数据检验下来,结论是:token 那一半兑现得比他说的还快,价值那一半暂时还立着。
    OpenRouter 的路由数据显示,中国模型的 token 量在 6 月初已经正式超过美国模型;到 7 月中,亚洲模型约占全平台 token 的 60%,年初以来份额翻了三倍。
    拉长一年看更惊人:Google、OpenAI、Anthropic 三家合计的 token 份额,从去年 6 月的约 70% 掉到了今年 6 月的约 30%;DeepSeek 单家占 16% 以上,已经是平台第一大供应商,V4 发布后半年内份额翻倍,agentic 工作负载是主要驱动。
    但框架的另一半同样成立:Anthropic 只占约 12–13% 的 token,收入捕获却远超按量计算的水平——在编程相关的支出里,Claude 系列长期占六成以上。市场正在分成两条车道:commodity lane 跑量,premium lane 收钱。
    当然要打个折扣:OpenRouter 的样本偏向开发者和价格敏感的流量,不能完全代表企业市场。但作为方向指标,它足够清楚。
    一个具体的例子是 Harvey。上周我和他们技术负责人聊天,他们用自有的法律数据,和第三方合作在开源模型上做了 RL 和 SFT,再配一个 router——结果比直接用 Opus 4.8 效果更好、成本更低。这可能就是未来的样子:前沿模型继续被重度使用,但越来越多的token流向task-specific的开源模型。
    标价正在失去参考价值:真正该算的是 Fully Loaded Cost
    另一个值得关注的变化是,模型之间的标价(Input / Output Token Price)正在变得越来越没有参考价值。企业真正关心的,不是每百万 Token 的价格,而是完成同一个任务的总成本。
    缓存命中率(Cache Hit Rate)、推理稳定性、Retry 次数、Token 效率都会影响最终成本。有时候,看起来便宜四倍的模型,在真实生产环境里,最终节省的成本可能远没有那么多。
    硅谷的一线反馈也印证了这一点。便宜模型如果一次通过率低,需要重试两三轮,token 价差很快就被吃掉;重试产生的缓存 token,还会反过来侵蚀账面上的成本优势。DeepSeek 把地板压得最低,靠的是极致低价;但一线用户抱怨最多的,恰恰是输出不够稳定、同一任务多次运行结果不一致。一个更便宜但更常失败的模型,在生产环境里可能并不便宜。
    所以这一节我最想留下的一句话是:真正该比的不是每百万 token 的标价,而是 fully loaded cost per successful task——每一次成功任务的完全成本。
    类似的算术也适用于 on-prem vs cloud 的争论。推特上有人认真算过账:GLM 5.2 的 API 价格是每百万 token 输入 $1.40、输出 $4.40;如果自购硬件本地跑,门槛约 2 万美元、输出约 20 tok/s——就算 24 小时全年跑满,也要 5 年半才回本。按总成本算,云的 token 效率仍然完胜本地。在算力紧缺、硬件迭代这么快的当下,这笔账只会越来越倾向云。
    最后是可用性——这是我认为被低估的约束。GLM 这类模型目前严重受制于芯片,主要通过 Together、Fireworks 这类推理平台提供,还没有在各大公有云全面铺开(虽然 AWS、Azure 已经开始上架部分中国模型);甚至Kimi因为算力不足,一度暂停过新用户订阅。中国模型的威胁值得跟踪,但现在下重注还太早。
    接下来我会用两个问题持续跟踪:
    1. 中国模型什么时候能在公有云上实现大规模、稳定的供给?
    2. 它们和 OpenAI、Anthropic 的差距,是在收敛还是在稳定?
    这两个问题的答案决定真实影响,而不是 Twitter 上的情绪。
    对投资意味着什么?
    Frontier Labs
    真正要重新思考的,不是 OpenAI、Anthropic 会不会被开源取代,而是市场是否需要重估它们的 ARR 增长假设。一个直白的判断:Anthropic 上半年的高增长里,有一部分来自"拿最贵的模型干杂活"——用 Opus 级模型跑非前沿任务。
    下半年,这些任务要么被 Token Optimization 砍掉,要么被路由给便宜模型。昂贵模型仍然承担最高价值的任务,但收入增长将更多依赖高价值推理,而不是所有 token 的同步膨胀。
    半导体
    我反而更乐观。担心 Token Optimization 压制 GPU 需求的人,忽略了Jevons Paradox:单位成本下降从来不会减少总消耗,只会扩大总需求——科技行业一贯如此。便宜的模型会把 AI 从 early adopter 推向 mainstream,而且别忘了,中国缺算力:这些开源模型最终要托管在算力充裕的地方。
    行业重心会从 Training 逐渐转向 Inference,但 GPU、HBM、高速网络、先进封装,仍是整条 AI 基建里确定性最高的方向。一个细节:像 Kimi K3 这样的巨型开源模型,只有最高 HBM 密度的机架才装得下——开源模型越大,存储厂商越开心。
    云基础设施
    云厂商未来比拼的不再只是有多少 GPU,而是谁能帮客户以更低成本完成推理——推理效率、模型部署能力、调度能力和 TCO 会越来越重要。中国模型的部署,实际上在增加而不是减少云端算力需求——这一点连 Databricks 都在公开确认。
    AI 软件
    最大的机会正在从模型层转向应用层和调度层。模型逐渐商品化,而能帮企业自动选模型、优化成本、提升 ROI 的平台——Routing、Inference Infra、Agent 编排——价值反而在上升。
    这也是 Fireworks这类公司越来越值得关注的原因:它们竞争的不是模型,而是企业 AI 系统的效率。风险项同样清楚:如果 Frontier Labs 面对更竞争的模型市场,选择加速向软件层垂直整合,Infra软件的日子不会好过(后面有长文章分析Infra软件层面的竞争和机会)。
    写在最后
    • Bear 两点:便宜模型跨过 good enough 这条线,多数任务被分流;Token Optimization 重演 2022–2024 年 Cloud Optimization 的剧本——当年多头也说"优化完会花更多",结果是连续四个季度减速。
    • Bull 两点:Jevons Paradox,更便宜意味着更大的市场——用 Factory 创始人的话说,"这块蛋糕四周绑着火箭助推器";而中国缺算力,开源模型受制于芯片供给,短期承载不了它们想要的流量。
    我自己更偏 Bull。但判断要能被证伪,接下来两个季度我盯四件事:
    1. Anthropic 和 OpenAI 的收入信号。如果上半年增长里确有"最贵模型干杂活"的虚胖成分,影响会最先出现在环比曲线上。今天X 上已开始流传第三方数据商的估算——Anthropic 的 ARR 仍在创新高,但增速的斜率开始变缓;同一份追踪里,OpenAI 反而在加速。这条曲线的争论,来得比我预想的还快。
    2. 中国模型的 availability。能否从 Together、Fireworks 走向公有云大规模稳定供给——这是从 token 份额走向收入份额的前提。
    3. Quality gap 的方向。比起 benchmark,我更相信 builder 的 retry rate。
    4. Fully loaded cost 会不会成为采购语言。如果会,很多基于标价的"便宜 5 倍"叙事都要重算。
    AI 的竞争没有结束,只是竞争函数变了。
    过去优化的是 Intelligence,未来优化的是 Intelligence per Dollar。
    12 个月后回来对答案。
    —— 辰子Tina
    写于 Google 财报出炉当晚, Palo Alto

    jinse.com.cn 0
    好文章,需要你的鼓励
    jinse.com.cn 0
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 金色精选 > 和15家硅谷AI公司聊完 我重新理解了开源与闭源之争
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部