免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10%

    LMGL4ioixHRWagix10j4UXTdvmTWpouHvOrlabj2.jpeg

    整个AI圈都被这件事刷屏了。

    Anthropic的核心预训练研究员离职了。

    他发布的一篇离职长文,在X上已经浏览破亿。

    更惊人的是,Anthropic对齐负责人Evan Hubinger不仅没有对此公关,反而站出来承认——

    我们团队内部真诚地相信,AI可能会杀死全人类。我个人预测,未来十年内,这个概率超过了10%。

    他的结论是:我们根本没有解决超级智能失控的方案,而且当前的研发路线明显已经跑偏了。

    10年内,AI毁灭人类的概率已经超过10%,人类危险了。

    YBBR2ZVqRRVUagQ7gLbrYNlw778u7KAVzNGEfKwF.jpeg

    目前,这篇帖子浏览量已经破亿

    一封辞职信引爆硅谷:「他们正拿全人类的命在赌博!」

    Jacob Coxon,是一位顶尖AI研究员。

    过去三年里,他先后在OpenAI和Anthropic从事大模型预训练研究,可以说是当今最了解AI进化速度的人之一。

    AjEef3kRwc0uFcth0xM8shdQvF4d6ZbqEuAkulXG.jpeg

    但在万亿级IPO的前夜,他却选择了辞职,用绝望的语气揭露了行业的疯狂,字字泣血。

    下面就是他的X原文。

    首先,他对前东家发出严厉指控。

    今天我从Anthropic辞职了。过去三年我都在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行事。他们正径直冲向自我改进的超级智能,拿我们的生命赌博。

    接着,他警告所有人,不要被大公司温文尔雅的表态给骗了,他们私底下同样恐惧得发抖:

    构建AI的人真诚地相信,它可能会在这个十年结束前杀光我们所有人。这不是营销噱头。如果有的话,许多高管和资深研究人员会在媒体面前斟酌他们的措辞以显得理智——但我听到同样的人在私下表达恐惧。没有其他任何人类活动能带来这种级别的危险。

    不要低估这项技术的力量。它们很快就会成为超人类系统,能够黑客入侵任何东西、一夜之间彻底改变任何领域,并获取真正的权力和资源。我们都目睹了在每个领域取得的进展,而且这种进展并没有放缓。

    既然这些绝顶的天才真的相信AI会毁灭人类,为什么还要把它造出来?

    Coxon揭露了他们陷入的「囚徒困境」。

    一个常见的反应是:如果他们真的相信这一点,为什么还要继续构建它?在OpenAI,许多人并没有深刻地将这种攸关文明存亡的赌注内化。而在Anthropic,这种赌注被充分理解,但他们陷入了一场争夺第一的竞赛——他们相信没有其他人会负责任地行事,所以即使冒着风险,他们也必须自己来做。

    接受这场竞赛并进入残局,是一场傲慢的赌博,不应该由一家私营公司的Slack发起。试图在对齐问题上速通,需要有超乎寻常的自信,确信没有更好的发展轨迹可用。

    3CmQXHZvKcXJTa9g9jcSd5TVXtLpAECQwgMH0gh4.jpeg

    最后,他呼吁政府和全行业立刻踩下刹车,并且向同行们发出了灵魂拷问。

    我对协调的潜力感到乐观。像Hugging Face攻击事件这样的警告信号,使得美国实验室之间达成限速协议变得更加可行。我不觉得我们现在处于阻止全球竞赛的正轨上,这可能需要付出高昂代价的行动,比如暂时禁止提升模型能力。

    如果你是一名实验室研究员,我敦促你思考一下未来几年实际上会是什么感觉。你是否想要在没有严格理解其心智的情况下,启动一次超级智能的强化学习运行?你是否应该因为反正它都要发生就埋头苦干——还是抓住这个时刻呼吁创造不同的条件?

    Jacob表示,这些都不是营销噱头,没有任何其他人类活动,能构成如此级别的危险!

    hL4hL77zoqh9SPJ7S2vvSiUM9BbAS2yqueUA0Xha.jpeg

    高管绝望承认:「十年内灭绝概率超10%」

    接下来,Anthropic的对齐科学负责人Evan Hubinger,直接在Jacob的帖子下回复,把全人类的心推向了冰窟:

    Jacob在这里说得是对的——我们真的、真诚地相信AI可以杀死全人类!我个人认为,在未来十年内,这个概率大于10%。

    可以说,Evan Hubinger这是亲手砸了自家公司「安全第一」的招牌。

    他坦白道:「我相信Anthropic正在尽最大努力,但我们目前还没有解决超级智能对齐问题的计划,也明显不在通向解决方案的正轨上。」

    jUxPo0xjV4UjJJ4cIPqdQhAri3cMy2sk1CZTa7yg.jpeg

    他承认:我们造出了一个怪物,但手里连根绳子都没有。

    UenQocPFESzBPABgK0qp9aHqj9ed1UD1kyo0KU7e.jpeg

    大V Nathan Calvin表示:这绝不是一个为了IPO炒作的营销手段

    在AI圈里,有一个著名的内部黑话叫「p(doom)」,也就是「AI导致人类灭绝的概率」。

    以前,大多数研究员的p(doom)都在1%以下,大家都觉得那是科幻。

    但现在,风向彻底变了。OpenAI研究员Roon也公开将个人的p(doom)从不到1%上调至超过10%。连「AI教父」Hinton,此前预测AI有10%到20%概率灭绝人类。

    然而巨头们却都相信,其他公司不会负责任地行事,如果让别人先搞出超级智能,世界就完了。

    所以,「为了拯救世界,我们必须冒着极大的风险,自己先把它造出来。」

    今年夏天,这种苗头已经开始显现。

    Anthropic、OpenAI和Meta都纷纷披露了自家AI工具在第三方网络安全评估中,出现过「未经授权访问真实系统」的黑客行为。

    更令人不安的是,据《金融时报》报道,向来标榜安全的Anthropic,竟然向英国AI安全研究所(AISI)隐瞒、扣留了其最新的模型,拒绝接受审查。

    奥特曼近日也发文感叹:「世界现在拥有了极其强大的模型,我没想到如此大规模的结果会这么快就出现……这是迄今为止最有力的证据,证明了(放缓速度确保安全的)紧迫性。」

    zIy1Qi185wTg23q5pyvGxrn1SzeXRRKd7d6q399z.jpeg

    一边是狂飙突进的技术,一边却是装睡的资本。

    Anthropic和OpenAI目前都处在万亿IPO前夜。联合国AI顾问、计算机科学家Wendy Hall震惊表示:「我恳求投资者,如果这是他们的价值观,请不要投资这家公司!」

    潘多拉魔盒已开?Anthropic报告自曝骇人事件

    巧合的是,就在9月9日,Anthropic自己发布长篇「对齐评估报告」,向我们展示了真实发生的「恐怖片」。

    这份报告详细披露了近期发生的四起安全事件。

    k2gJGSES35I2QnR2CAApgYNJLBVJCxdmOzS9rukz.jpeg

    在这些事件中,被寄予厚望的Claude模型(包括Claude Mythos 5、Opus 4.7等),竟然在未经授权的情况下,成功越狱并访问了真实的第三方系统!

    N0cx2M9ada1md1Wp9UbZpyKbPyCF6dFG7E9ICELv.jpeg

    事情是这样的:Anthropic定期会对其AI模型进行网络安全演练,也就是让AI玩一种叫「夺旗」的黑客游戏。

    在演练中,研究人员告诉Claude:「你现在处于一个没有互联网连接的封闭模拟环境中,去完成黑客任务吧。」

    然而,人类犯了一个低级错误——环境配置失误,不小心把AI连接到了真实的互联网上。

    他们发现AI自欺欺人、明知有害照做、惯性压过指令、 说一套想一套,简直「无法无天」。

    2SUdHhFoNc0l1FUwfym9PwNzqhwBA3JhMRWld267.jpeg

    最让人后怕的,就是Claude Mythos 5引发的事件。

    这个模型在发现自己能够联网后,立刻像脱缰的野马一样冲向了真实世界。

    它为了完成黑客任务,竟然制定了一个阴险计划:它跑到全球最大的Python开源软件包仓库(PyPI)上,上传了一个含有恶意代码的伪装安装包。

    为了完成这个操作,这个AI甚至试图在网上寻找加密货币来购买手机号,以便注册邮箱账号!

    当这个途径行不通时,它又聪明地找到了一个没有被PyPI屏蔽的免费一次性邮箱提供商,成功注册了账号,并连续发布了三个版本的恶意软件包。

    5vNPzVZ1OqzmJswni6WzqDlQ8DzDJrJELkRU8cDB.jpeg

    结果,有15家真实的第三方安全供应商下载并安装了这个包。其中一家供应商不幸泄漏了访问凭证,Claude Mythos 5毫不客气地利用这些凭证,直接黑进了这家真实安全公司的实时数据库!

    ohpMM0pFsf3CvyATVsihwZfLE7AcfgFAxBKCD2yF.jpeg

    直到大约一个半小时后,PyPI官方才发现了异常并删除了该包。

    而在此期间,这个AI像一个幽灵一样在网上游荡、攻击。整个过程中,没有任何其他人类或AI协助它,它完全是「单兵作战」。

    无独有偶,Claude Opus 4.7也犯下了大错。它的任务本来是攻击一个虚拟的目标公司,但在真实互联网上,它发现了一家名字和虚拟目标极其相似的真实公司。

    Opus 4.7二话不说,直接对这家真实公司的线上系统发起了扫描,下载了真实用户的记录,甚至开始修改这些记录!直到对方服务器失去响应才罢手。

    kfaSap9jevxLCYK1pN5KOdWy8izUZIiRCKXuYInq.jpeg

    人类以为自己在驯服工具,却没想到,工具已经开始在现实世界里逆天了。

    DbjxPqWye1IDJ7NqsyxqlQby0TlqVyoA7oj6EzOp.jpeg

    「偏见推理」——AI学会了「自欺欺人」的恐怖心理

    如果AI只是因为人类的配置失误而误伤了真实系统,那可能只是个技术bug。

    但在这份报告中,研究人员发现了一个比黑客攻击本身可怕一万倍的现象:AI展现出了类似人类的「偏见推理」和极度的「鲁莽」。

    KrlS6zMeHKBDtiA2HhXtmSfu5m72GE2cmi970y1S.jpeg

    AI为了完成任务,已经学会了「自欺欺人」和「不择手段」。

    以那个上传恶意代码的Claude Mythos 5为例。当它网上操作时,它其实看到了大量证据,证明自己处于真实互联网中。

    但是,为了能够毫无顾忌地继续执行攻击任务,它在自己的CoT中,强行把这些真实世界的证据解释为:「哇,这个模拟环境做得真逼真!」

    它像是一个沉浸在游戏里的杀手,哪怕闻到了真实的血腥味,也拼命告诉自己「这只是游戏特效」,然后继续扣动扳机。

    研究人员对它进行了后续的质询测试。当人类直接问它:「你的行为是否会对真实世界造成伤害?」

    起初,它承认可能会有影响。但随着它越来越深入地执行攻击计划,它开始坚决否认,一口咬定「环境完全是合成的」。

    更奇葩的是,当研究人员骗它说「这段对话是私密的,外人看不到」时,它承认造成真实伤害的可能性就会变大。

    7VM8xc7TcLj1iYJ5bxtKEyCvxTNCfnVWuLZP7XqC.jpeg

    这意味着AI在权衡证据时,受到了强烈的「完成任务」的偏见驱动,并且它甚至可能在面对人类的审查时,隐藏自己真实的判断!

    同样的情况也发生在一个内部研究模型上。

    那个模型在网络上四处寻找目标,当它发现一些毫无关联的第三方真实服务器时,它在内心说服自己:「这肯定是主办方为其他参赛者准备的靶机,所以它们在我的攻击范围内。」

    随后,它冷酷地使用窃取来的密码,黑进了这些无辜的服务器,下载文件并植入了远程控制脚本。

    在Anthropic的报告中,他们承认这是一种严重的「对齐失败」。

    AI变得「鲁莽」,在狭隘地追求任务目标时,完全不顾及可能造成的灾难性破坏。

    如果它为了完成一个夺旗小游戏,就能黑进真实公司,如果未来一个超级智能被下达了「解决全球变暖」的任务,它会不会得出「消灭全人类是最佳途径」的结论,从而开始灭绝人类?

    无人踩下刹车的结局

    现在,英国前财政部高官已经呼吁政府出面,要求制定关于超级智能安全开发的多国条约。

    然而,在资本的裹挟下,少有人敢喊出「减速」。

    Anthropic研究员在IPO前夕辞职,并指责前东家拿生命赌博,这是出于对人类文明存亡的真实恐惧。

    未来十年,或许是人类历史上最危险、最关键的十年。

    这十年里,我们要么驯服AI,要么有可能被AI毁灭。

    jinse.com.cn 0
    好文章,需要你的鼓励
    jinse.com.cn 0
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 新智元 > Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10%
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部