免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    黄仁勋、Kimi K3 与一场即将到来的开源战争

    作者:卡兹克

    你要说最近AI行业里,最热的、被讨论最多的一件事。

    那必然就是一个由老黄、Anthropic、kimi、开源,这几个看着风牛马不相及的4个词,共同串起的故事。

    故事是这样的。

    前几天,7月24日,黄仁勋发了自己在X上的第一篇帖子。

    TS64lfURAfmAgX3Evy6WNhpsL4hkoP5IrvUyQMfT.jpeg

    这个AI圈可能最火的男人,为了发这封公开信,不惜注册了个X。

    这封信的名字叫《Open Weights and American AI Leadership》,开放权重与美国AI领导力。

    cuCJ8G3DNASO80sR0lbXesj2V5dZmeBLGiay4p2O.jpeg

    大概意思就是,AI会改造每一个行业,驱动每一家公司,也会被每一个国家建设。

    开放模型能强化安全、加快创新,也能带来技术主权。

    这个世界既需要最前沿的闭源模型,也需要最前沿的开放模型。

    咱们不能制裁开源模型啊。

    老黄之所以这么操碎了心,其实是有前情提要的。

    我们把时间拨回11天前,那天有一个标志性的事件发生。

    7月17日凌晨,Kimi K3正式发布。

    qVv4ZtSlwvGCZOmmRC84p1DrLu4YHJXXTWRKEoq1.jpeg

    2.8万亿总参数,1040亿激活参数,原生视觉能力,100万Token上下文。

    最关键的是,Kimi当时就承诺,模型权重会在7月27日(也就是昨晚)正式开源。

    这,是全球首个开源的3T级模型。

    一个中国团队,在算力远没有那么宽裕的情况下,做出了一个能力逼近全球最强闭源模型的东西,还要把权重交给全世界。

    这一下子,美国那边的气氛就变得不对劲了。

    7月22日,美国白宫科技政策办公室负责人Michael Kratsios公开指控月之暗面,声称Kimi K3的开发使用了对Claude Fable 5的大规模蒸馏。

    tqBNhRT0WM22EbfacMz3gMGlw15PipifMreEOKJo.jpeg

    不过有趣的是评论区。

    大家可以看看群众的呼声。

    0xosYxT78PmvKTNWczcJs98jIBwi93MC3uHIX4cn.jpeg

    然后呢,美国财政部长好死不死,火上浇油,又提到了贸易黑名单和制裁。

    wdu01SmXjmiQOD1nrXAfznhJesFMVnqY1WBUTcJe.jpeg

    评论区这下彻底沦陷了。

    teI3HNMYjzX332nz0brYvt1F8mQBNzBqpOcq2XkW.jpeg

    lwPXaf5UmlqP5Lzf8fob2U3DjRuva2ctDGpKCvE2.jpeg

    ZR6h0ySjHJyUvwRXyQvmXMcas6TNNXS3ePQHmQOG.jpeg

    这个事越闹越大,眼瞅着一场原本关于模型能力和开源路线的竞争,迅速被拖进了知识产权、国家安全、出口管制和中美科技竞争里。

    也就在这个时间点,黄仁勋站出来了。

    他接受采访,公开反对封禁中国开源模型。

    HGKbnayjf6qwEZPv6uQSC58vyxy5kOJImfy0TR3B.jpeg

    讲道理,老黄为了卖卡,真的是操碎了心。

    然后呢,在最下面,一个很长的Logo墙被贴了出来,整个科技行业开始排队在公开信上签名。

    公开信刚发布的时候,签名的有25家公司和组织。

    英伟达、微软、Meta、IBM、戴尔、Palantir、Mistral、Hugging Face等等等等。

    到了周末,名单开始疯狂变长。

    OpenAI来了,Google来了,SpaceX来了,AMD、Cisco、Cloudflare、GitHub、Linux Foundation、Mozilla、Vercel、Y Combinator、OpenClaw等等,也全都来了。

    到我写这篇文章的时候,已经有77个签署者了。

    zSDCxEHjSBLuQtCAl7CxCnjsRKAOyTUZbvwbPjCY.jpeg

    也有无数的大佬疯狂打Call站台。

    cAS63sTWfxp7ZRKyuD20ygVejtFUWljgE0FIGK6g.jpeg

    好久好久好久没见过这么集结,一起起义,同仇敌忾的了。

    但是如果细心的朋友就会发现,上面那个logo墙,几乎集结了美国绝大多数的前沿科技公司,甚至英伟达和AMD都世纪同框了,但是你会发现,莫名其妙的怎么缺了一个熟悉的名字。

    Anthropic。

    我觉得这张世界名画可以改名叫《Anthropic在哪里?》。

    甚至有网友直接恶搞做了一个视频。

    而就在Anthropic装死,美国科技巨头们联手推特上书起义之时。

    本次事件的导火索,在昨晚,也就是7月27日晚上23点13分,正式官宣了Kimi K3开源。

    0I6K1YEN7vh1xcpxKnpmYzktCn6wMcHlK8YpmszP.jpeg

    而且这个开源程度,远超乎我的意料。

    我本来以为只是开源模型权重而已。

    j65CyqKehWtCzzIuBcZIEIl05RQLgKVWXyKWwc0W.jpeg

    结果。

    模型权重,开源。

    详细的技术报告,也放出来了。

    训练K3用到的关键Infra,也开源。

    全都开。。。

    我大概列举一下。

    Kimi K3模型权重,一个2.8万亿参数的MoE模型,一共有896个专家,每个Token激活其中16个。

    然后是K3完整的技术报告,一共47页。

    uzlQ8NfSZb9iy9NIyc7PIvJnmfsrLZVVZQ6E8HA5.jpeg

    这里面公开了KDA和Attention Residuals的架构细节,解释了他们如何用3比1的比例混合KDA与Gated MLA,如何让信息跨越几十层继续流动。

    ZT2Jio9b05pq4KRKaqUoAuDRG5xJIEAweWOHZdsf.jpeg

    还有Stable LatentMoE。

    896个专家只激活16个,稀疏程度高得离谱,Kimi又用SiTU GLU、Quantile Balancing这一整套方法,把这种极端稀疏的训练维持在稳定状态。

    wFe80SjDEBuIkR9c8KoTo65MGITX0Me6XWhZxbvv.jpeg

    还有MoonViT V2、百万Token上下文的强化学习基础设施、大规模任务合成、后训练方法,接近20个内部评测集的完整结果也放了出来。

    FVOSeG0vdE40u80skMtQizxWH7rAlHiEhupKvNGK.jpeg

    这个技术报告很详细和扎实,推荐一读。

    除了技术报告之外,还有开源的关键infra技术。

    MoonEP,一套专门为超大规模MoE打造的专家并行通信库。

    8gjRXv4s502kza1gvFM9aYBwM8roSlW97D7b1JOm.jpeg

    MoE训练时,经常会出现某些专家忙得要死,某些专家闲得抠脚,最后所有GPU都得等最忙的那一张卡。

    MoonEP会根据当前路由结果,动态复制一小部分热门专家,让每张卡收到完全一样数量的Token,同时维持静态内存形状,避免训练越跑越碎,最后直接OOM。

    这已经属于超大模型训练里非常底层、非常值钱的东西了。

    FlashKDA,Kimi Delta Attention的高性能算子。

    KlY52Vj7R80Pk3JJZedXxLxZTKGAcWVGePvSR0mH.jpeg

    它用CUTLASS实现,在英伟达H20上,相比flash linear attention基线,prefill速度提升了1.85倍到2.31倍,还可以直接接进现有的flash linear attention后端。

    再往下,还有AgentENV。

    IyDjavw8l1sYlhpWYw5NI2WVzOnEd8Q1sXgi0Kkm.jpeg

    这是Kimi和KVCache.ai一起做的分布式Agent沙箱系统,也是K3做大规模Agent强化学习时真正跑环境的那层底座。

    它可以在一堆机器上同时启动海量Firecracker微虚拟机,环境恢复低于50毫秒,暂停低于100毫秒,还原生支持快照、恢复和fork。

    一个Agent跑到某个关键节点以后,可以直接分叉成几十条互不干扰的轨迹,继续并行探索。

    虽然我对底层技术不是很了解,只是纸上谈兵的一些浅薄知识,但是从这几个技术来说,我觉得已经能感受到真香了。

    真的就是掏老底了。

    • MoonEP解决超大MoE模型的通信和负载。

    • FlashKDA解决新注意力架构的算子效率。

    • AgentENV解决Agent强化学习需要的海量真实环境。

    开源社区要起飞了。

    如今,我愿将Kimi和DeepSeek并称为开源二圣。

    我也读了一下这次Kimi K3的许可证。

    rz5xNPHxeqQ9x5hwXI3LzzSJ1UCoEwEZkRzLMDEd.jpeg

    普通研究者、开发者和公司,可以免费使用、复制、修改、部署、微调、分发,也可以做衍生产品和商业化。

    它只给超大规模商业使用留了两道门槛。

    如果你做模型服务生意,公司及关联方连续12个月总收入超过2000万美元,需要另行和月之暗面签协议。

    如果使用K3的商业产品月活超过1亿,或者单月收入超过2000万美元,产品界面需要显著展示Kimi K3。

    对,需要显著展示Kimi K3就行。

    菩萨啊。。。

    已经有人说,如果Kimi K3能给他带来单月2000万美元的收入,别说显著展示Kimi K3的品牌标识了。

    他可以把Kimi的logo纹在屁股上,甚至可以纹两个。

    今天这晚,随着Kimi K3的开源,我感觉把整个事件,推向了最终的高潮,舆论基本一边倒。

    TFf1SqO96PIAwKjAbG3CBGlI4PttDMN9OP5M1j3s.jpeg

    也在Hugging Face中,创造了历史。

    gULAl4wlUmkwQoMDUU3Wyf2aCchHzsOijfoQAWGb.jpeg

    这一刻,美国的态度,和Kimi K3开源,有了一种神奇的化学反应。

    未来,这件事有可能被史称为:AI行业的萨拉热窝事件。

    这个世界,需要开源。

    老黄他们拥抱开源,当然除了理想之外,还有很多金钱的气息。

    2002年,Joel Spolsky写过一个很经典的商业规律,叫Commoditize Your Complements,把你的互补品变成商品。

    一个东西的互补品越便宜,人们对这个东西的需求就越大。

    英伟达卖GPU。

    开源模型越多,全球就有越多公司愿意自己部署、自己微调、自己训练,最后需要的GPU也越多。

    AMD、戴尔、云计算公司、推理服务商,逻辑差不多。

    GitHub、Vercel、Replit、LangChain、OpenClaw这些开发工具和应用平台,也天然希望底层模型越来越多、越来越便宜、越来越容易替换。

    因为模型成本每降一块钱,应用层就多出一块钱的空间。

    老黄坚定的相信开源,以及老黄是开源模型的最大受益者之一,这两件事不冲突的。

    但是我坚定的相信、也拥抱开源。

    原因也特别简单,因为,我是个普通人。

    这辈子,我可能都训练不起K3这样的模型,我没有几万张卡,我什么都不懂,技术报告里的公式,我都只能在AI的加持下勉勉强强看懂一点点。

    但是不妨碍我,今天,踩在无数前人开源的工作、框架还有模型上,来创作我自己的作品。

    普通人能参与每一次技术革命,靠的其实就是前面那些前辈,愿意把终点留下来,给后来的人,当起点。

    我们没有突然变成天才。

    我们只是,不用从零再走一遭。

    开源真正厉害的力量就在这里。

    一个团队花掉巨大算力、无数大佬熬了很久才得到的东西,一旦公开,第二天就会成为全世界无数普通人的公共起点。

    我觉得,这就是文明的复利。

    最后,向所有为人类世界、开源世界、AI世界的大佬们。

    致以我最崇高的敬意。

    q5Rvcbl9MB47QLo0tBy9YGsQp93dj06YlVUDweHX.jpeg

    谢谢你们。

    jinse.com.cn 1
    好文章,需要你的鼓励
    jinse.com.cn 1
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 数字生命卡兹克 > 黄仁勋、Kimi K3 与一场即将到来的开源战争
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部