免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    Kimi K3震撼全球AI 美国为何留不住杨植麟

    陶朱,金色财经

    摘要:2026年7月16日,月之暗面正式推出Kimi K3。Kimi K3在能力上已接近美国前沿人工智能实验室Anthropic所开发的模型。这一进展表明,中美两国在最先进人工智能领域的差距正不断缩小。

    一、Kimi K3概览

    《Kimi K3:智能的新前沿》介绍,Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。

    虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但它在整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。

    Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。这两项架构更新,都是为了让信息在更长序列和更深模型中流动得更顺畅。模型也进一步扩大了 Mixture of Experts(MoE)的稀疏度:结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力。

    Kimi K3 具备很强的长程编码能力。在极少人工监督的情况下,它可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。Kimi K3 也擅长结合软件工程与视觉推理的任务。它能够利用截图和视觉反馈,优化游戏开发、前端和 CAD 等场景。

    据AI模型评测平台Arena显示,Kimi-K3已在Frontend Code Arena中以1679分位居第一,超越了Claude Fable 5。

    评估人工智能模型性能的独立公司 Vals AI 首席执行官雷扬·克里希南表示,根据该公司运行的基准测试,Kimi K3的表现略逊于Anthropic的Fable 5模型,但优于OpenAI的旗舰模型GPT-5.6 Sol。

    就在Kimi K3上线的48 小时内,需求增长远超预期,GPU 资源接近承载上限。为保障现有订阅用户体验,平台甚至暂时暂停新增订阅。

    二、Kimi K3 引发全球AI行业震动

    在预测市场Polymarket上,Anthropic年底前估值达到1.5万亿美元的概率大幅下降。市场交易者普遍将这一变化与Kimi K3发布后的市场情绪变化联系在一起,并称Anthropic的估值预期受到冲击。7月17日,交易者认为Anthropic年内触及1.5万亿美元估值的概率约为77%;到7月18日,该数字降至67%,一天内下跌约10至11个百分点;截止7月20日,概率为66%。交易者认为Anthropic年内触及1.25万亿美元估值的概率最高,为92%。

    受Kimi K3发布的影响,7月17日,Alphabet和Meta的股价分别较前一日下跌2%和3%;彭博亚洲半导体指数跌超6%;纳斯达克100期货跌约2%。

    在面临用户流失的压力时,各大美国模型突然开始频繁重置免费用户的限制:Anthropic抹去了Claude用户的免费额度上限;OpenAI也在同一天重置了Codex的使用限制;Grok甚至在短短一周内重置了两次限制。这种罕见的“慷慨”本质上是一种恐慌性算力赠送,目的是通过提升免费体验来强行留住被廉价开源模型吸引走的开发者和用户。

    研究中国开源人工智能生态系统的斯坦福大学教授格雷厄姆·韦伯斯特表示:一个模型是否处于绝对领先地位并不重要,因为中美领先模型之间的性能差距已经缩小。“对于中国落后美国多少个月,每个人都有不同的数字,估计普遍集中在六个月左右。这算不上多大的领先优势。”

    在美国,认为中国企业的AI性能“将在6~12个月内赶上(美国)”(Anthropic的首席执行官达里奥·阿莫迪)的看法已成为主流。从性能指标来看,Kimi K3虽然不及Anthropic和OpenAI的最新模型,但很多观点认为超越了上一代技术。如果Kimi K3的性能与Anthropic的“Opus 4.8”(5月发布)和OpenAI的“GPT-5.5”(4月发布)相同,那么仅从一般提供的AI来看,中国可能在3个月左右就赶上了美国。

    三、由Kimi K3引发的留住人才讨论

    Kimi K3 发布后引发部分美国人的讨论:美国为什么没能留住Moonshot创始人杨植麟。

    1.杨植麟是谁

    杨植麟是一位90后天才。1992年出生于广东省汕头市,本科就读于清华大学最初主修热能工程,后主修计算机。

    从清华大学毕业后,前往美国卡内基梅隆大学攻读博士学位。师从鲁斯兰·萨拉胡特迪诺夫(苹果公司人工智能研究总监)和威廉·科恩(谷歌DeepMind首席科学家)。在攻读博士学位期间,他曾在谷歌大脑和元平台公司工作。他还与图灵奖得主约书亚·本吉奥和扬·勒昆合作撰写了关于计算机推理和模式识别的论文。

    博士毕业后,杨植麟回国创业,参与创办 Recurrent AI(循环智能)。主要利用 AI 技术分析销售沟通数据,帮助企业提升销售效率。

    2023 年,杨植麟联合团队成立 Moonshot AI(月之暗面)。公司名称来源于 Pink Floyd 乐队经典专辑《The Dark Side of the Moon》。月之暗面的目标是开发具有更强通用能力的大模型,推动 AI Agent 和通用人工智能方向的发展。公司核心产品包括:Kimi 智能助手、Kimi 大语言模型系列、长上下文 AI 应用等。Kimi 被认为是中国大模型创业公司中的代表产品之一,与OpenAI、Anthropic等国际 AI 公司展开竞争。

    2.美国为何没能留住杨植麟

    1)杨植麟的回国创业梦

    杨植麟在卡内基梅隆大学的导师Russ Salakhutdinov发文表示:苹果公司一位高级副总裁(蒂姆·库克的直接下属)曾问杨植麟是否会考虑加入苹果,杨植麟表示想回中国。苹果的回复是,如果杨植麟愿意,可以加入苹果北京办公室。但杨植麟当时非常坚定地要回中国创办一家初创公司。杨植麟说,如果他不至少尝试一次自己创业,他会后悔一辈子。

    wwmNrKkLuXZJX6NyOxhY03usoP4hWYxsqOUWbbPK.jpeg

    2)移民政策阻碍

    牛津大学AI博士生JundeMorsenWu发文表示,由于美国移民政策(如PP10043和绿卡国别积压)的阻碍,加之中国不断提供高薪、住房和经费等优厚条件,在牛津攻读人工智能博士的我正逐渐动摇,开始怀疑是否还应坚持前往美国这个似乎并不欢迎我的国家。

    对JundeMorsenWu的推文,潘兴广场CEO Bill Ackman表示,美国需要改革移民政策,以便接纳真正的创造者,让他们在美国本土发展,创造价值。尤其令人费解的是,把最优秀、最聪明的学生送进联邦政府资助的教育机构,然后又把他们送回国。

    6jDfz22alXn2BVGY3T5xexO8ygctyEXHgy9xDZT3.jpeg

    在Russ Salakhutdinov的X帖子下,有大量网友加入讨论。其中有支持杨植麟回中国创业的声音,也有人质疑美国留不住人才。

    • @AKJay59396046:在美国,他可能不得不和一个像Altman这样骗子似的家伙共同创办他的初创公司,这个家伙抢走所有的风头,然后像对待奴隶一样踢他,因为前者与风险投资黑帮的文化亲和力和影响力。很可能,他最终只能成为一名创始员工,勉强作为一个向能说会道的印度CTO汇报的技术苦力混日子。在中国,我怀疑情况会有所不同。他会如鱼得水。黄仁勋可能属于某种“亚洲人”——一种凭借自身个性,加上技术能力,能够克服制度性偏见的人。

    • @Orangeman1992:他来这里学习,把家人留在家乡。他学完了就回去了。他没有义务留在这里,特别是当中国为他提供了很好的机会和优质的生活方式时。我和耶鲁大学的一位教授聊天,他告诉我几个他的白人美国学生毕业后在中国找到了工作。

    • @ArcherZmq:从这么多愚蠢的回复来看,我认为他回中国确实是正确的选择。

    • @btc_albert:核心观点:现在已经不再明确美国是否是人们长期发展职业生涯的最佳地点。 如果我们希望顶尖人才留下来,我们需要解决以下所有问题: 种族主义和歧视的结合、缺乏安全保障、缺乏道德/滥用权力,以及缺乏改善生活的基建投资,这些问题已经累积到让人们不再那么有动力留下的地步。

    • @AvidFayaz:美国移民政策不仅应当允许,而且应当以鼓励这类人选择在美国而非其他市场创业作为目标。

    • @PlatoCosmos:我认为最聪明、最优秀的人正在选择返回他们的祖国创业。他们不会因为签证问题而浪费生命中最美好的几十年。比起美国,海外的VC资金虽然没有那么多,但也非常充足。我们需要反思,为什么有人会选择留下来,牺牲几十年只为了留在这里。我们不应该对此习以为常。

    四、业界的声音

    • 前白宫加密和 AI 主管 David Sacks 在 X 平台发文表示: 中国 AI 模型 Kimi K3 首次登顶 Frontier Code Arena 前端代码评测,并在其他多项基准评测中达到或接近行业领先水平,这一趋势值得关注。在中国 AI 能力快速提升的同时,美国正因监管争议陷入内耗。他批评部分美国政界人士和监管机构限制新数据中心建设、增加州级监管要求,并推动成立新的联邦机构,对前沿 AI 模型进行事前审批。 David Sacks 警告称,如果美国因过度监管放缓创新速度,可能在全球 AI 竞争中失去优势。“美国凭借无许可创新(Permissionless Innovation)赢得了互联网时代,也可以通过同样方式赢得 AI 时代;否则,我们将看到领先地位逐渐消失。”AI 发展仍需解决安全风险,但监管应采取精准方式,而非阻碍技术创新。其言论再次引发关于 AI 监管、算力基础设施建设以及中美 AI 竞争格局的讨论。

      7月20日,David Sacks 再度发文:Kimi K3刚刚修复了15个关键安全漏洞,而Codex和Fable之前因“网络安全护栏”限制而拒绝处理这些问题。对于外国模型能顺利完成的任务,没有理由去限制美国模型。这样做只会削弱我们自身的竞争力。

    • 特斯拉CEO埃隆·马斯克在相关评测报道评论区留言:“令人印象深刻。”随后在7月18日,马斯克在社交媒体平台“X”上透露,其2T参数模型将于下周完成初步训练,新模型将全面优于1.5T的版本,他还表示,该模型可能可以超越Kimi。

    • SemiAnalysis月之暗面旗下大模型Kimi K3采用线性注意力机制,引发市场对英伟达、HBM以及网络设备需求可能受到削弱的担忧。不过,半导体研究机构SemiAnalysis近日给出了截然不同的判断:K3庞大的参数规模和推理架构需求,不仅不会削弱高端AI硬件需求,反而可能进一步强化对英伟达高端GPU、HBM以及高速互联设备的需求。 SemiAnalysis指出,K3参数规模超过2.8万亿,模型权重容量超过1.5TB HBM。即便在相对有限的用户并发场景下,KV缓存仍需要大量卸载至CPU DDR5内存及NVMe存储,HBM空间并不会出现明显富余。更重要的是,月之暗面此前透露,K3的高效推理部署需要至少64颗芯片组成的大规模扩展域架构。这一硬件需求与英伟达GB200/GB300 NVL72等机架级AI系统的设计方向高度匹配。 SemiAnalysis认为,市场此前将线性注意力理解为“削弱GPU需求”的逻辑存在偏差。真正的影响可能恰恰相反:更高效的模型架构降低了AI推理成本,将推动更多应用落地,进而刺激GPU、HBM、DRAM以及网络基础设施的长期需求。

    • 中信建投研报指出,坚定看好AI产业趋势。我们认为,K3是本周全球大模型行业的分水岭事件,也是另一个DeepSeek时刻:K3的发布意味着中国大模型第一次以“竞争威胁”身份进入全球大模型叙事——2.8 万亿参数 + 100 万上下文 + Code Arena 登顶,证明国产模型已在Agentic Coding主战场与美国前沿模型正面交锋。其他建议重点关注应用层机会:1)K3提升了开源模型智能水平,应用层使用tier1模型的门槛、成本预计均将降低,利好后续应用场景进一步打开;2)头部和第二梯队模型厂商的竞争均较为激烈,竞争维度已经从模型能力延伸至价格、产品力、场景拓展、成本优化等,我们认为利好应用层。

    综上,从美国科技界到华尔街研究机构,再到国内券商,均认为Kimi K3的发布标志着中国基础大模型首次以全球竞争者的身份进入国际AI产业核心叙事。

    五、中国其他优秀的AI大模型

    1.DeepSeek

    2023年由梁文锋创建于杭州,估值已经超过3500亿元。DeepSeek版Claude Code即将上线,Harness将与V4正式版同步发布。它是一款代码智能体产品,内部对标 Claude Code,负责让模型读写文件、调用工具、执行命令,并持续完成工程任务。

    DeepSeek 已被腾讯、华为、阿里云等多家云平台和企业生态接入,同时支持大量开发者通过 API 和开源模型进行二次开发。DeepSeek 重新定义了开源大模型的竞争方式,其低成本、高性能的训练策略推动全球 AI 企业重新思考模型研发模式,被认为是中国 AI 国际竞争力的重要代表。

    2.智谱AI

    智谱 AI由唐杰(联合创始团队源自清华大学知识工程实验室)于2019年创建,是国内最早布局大模型研发的企业之一,也是国内最早实现 GLM 系列模型商业化的公司。

    2026年6月,智谱AI GLM-5.2问世,是新一代旗舰级基座大模型,专注于超长程任务与AI编程能力。其核心亮点在于支持真正可用的1M(100万)无损上下文,并在全球编码基准测试中位居开源模型前列,性能直逼国际顶级闭源系统。其性能几乎与美国领先系统、Anthropic的Fable 5模型同样强大。

    业内认为智谱 AI 学术积累深厚,是国内企业级大模型的重要代表,在 ToB 市场具有较强优势。

    3.MiniMax

    MiniMax 由闫俊杰于2021年创建,是国内 AI Agent 和 AI 陪伴产品的重要探索者。

    7月8日,有知情人士透露,MiniMax正在研发一款参数量达2.7万亿的全新大语言模型,规模超过目前市面上所有国产人工智能大模型。这款新模型最早有望于今年第三季度发布。参与研发的内部员工将其内部代号定为M3 Pro,但暂不清楚公司正式对外发布时是否会沿用该名称,MiniMax计划将该模型开源。

    4.阿里千问

    阿里千问于2023年由阿里云推出。

    7月19日,阿里千问表示,Qwen3.8即将发布并开放权重。该模型拥有高达2.4T的参数规模,且正在持续进化。阿里千问指出,其性能可与领先的前沿AI模型媲美,仅次于Fable 5。Qwen3.8-Max-Preview已首次亮相,并上线阿里巴巴的Token Plan、Qoder和QoderWork平台。

    5.零一万物

    李开复于2023年5月创立零一万物,成立六个月即晋级独角兽公司。零一万物早期主打自研Yi系列大模型,但受大模型训练经济效益变化影响,现已重置业务,重点转向企业人工智能基础设施和AI Agent(智能体)平台。

    Yi 系列模型发布后在 MMLU、Chatbot Arena 等评测中表现突出,尤其在长上下文和多语言能力方面获得较高评价。

    零一万物计划在2027年进行IPO,目前,零一万物寻求在赴香港交易所上市前,完成一轮融资。

    6.百川智能

    由搜狗创始人王小川创办于2023年,公司定位为打造世界级基础大模型,并重点布局医疗 AI。

    6月23日,百川智能与清华大学联合发布新一代医疗增强大模型Baichuan-M4,在HealthBench等三大权威榜单中均位列世界第一,事实性幻觉率降至3.3%。针对通用大模型在医疗场景缺乏主动追问能力、易产生幻觉的痛点,M4实现了深度问诊、全病程记忆、证据锚定与Agent架构四大核心能力突破。依托Baichuan-Harness架构,M4实现了问诊、记忆与循证的自主编排,从单纯的医疗大脑进化为能独立完成连续诊疗的医疗智能体。

    jinse.com.cn 3
    好文章,需要你的鼓励
    jinse.com.cn 3
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文系金色财经原创稿件,版权属金色财经所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:金色财经",违者将依法追究责任。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 金色财经 > Kimi K3震撼全球AI 美国为何留不住杨植麟
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部