免责声明:金色财经所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(jinse.com.cn) 举报

    奥特曼开掉3人 OpenAI又出大事了

    OpenAI三员大将,同一天被扫地出门!

    就在刚刚,外媒爆出猛料,OpenAI以「泄密」为由,开掉了安全团队的三名研究员。

    他们全是那篇CoT监控论文的作者,其中两位还是一作。

    讽刺的是,OpenAI刚因为新模型GPT-6.1 Astra太会骗人,在DevDay前一天紧急叫停了发布。

    现在倒好,AI越学越狡猾,OpenAI却先把能看穿它的人开掉了。

    OpenAI大地震:专盯AI脑子的3人一夜出局

    事情是这样的。

    10月1日上午,X上突然传出风声,OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang一起「离职」了。

    大家原本以为,这不过是硅谷又一波正常的人事流动。

    结果中午一篇报道出来,「离职」直接变成了「开除」。

    官方声明是这样写的——

    我们已与三人分道扬镳,原因是他们违反了公司关于获取和处理敏感信息的政策。

    调查证实,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,也破坏了我们工作赖以进行的信任。

    很快,外媒又挖出了OpenAI没说的细节。

    被指泄露的,有一部分是OpenAI的基础设施架构,也就是它的系统到底是怎么搭起来的。接收方,正是一家专门测试AI模型的外部组织。

    三人里,两位是安全研究员,一位是研究项目经理。

    其中Korbak,还是Redwood Research和METR调查Hugging Face被黑事件时,OpenAI这边的技术对接人。

    「CoT可监控性」核心作者,Hinton、Ilya站台研究

    这三个人,都是从外部安全机构走进OpenAI的。

    Korbak和Jasmine Wang都在英国AI安全研究所待过,Korbak还在Anthropic干过,Balesni则来自第三方评估机构Apollo Research。

    进了OpenAI,他们死磕的就一件事,盯住AI到底在想什么。

    推理模型在给出最终答案前,会先写一大段推理草稿,这就是思维链。

    思维链监控,就是派另一个模型去偷看这份草稿,看它有没有在背地里盘算作弊、撒谎。

    Korbak和Balesni,是《思维链可监控性》论文的前两位作者,Jasmine Wang也在署名之列。

    这篇论文的署名横跨OpenAI、Anthropic和谷歌DeepMind,图灵奖得主Bengio也在上面。连OpenAI现任首席科学家Jakub Pachocki,都是作者之一。

    论文的核心发现是,模型在草稿里常常会把坏心思直接写出来,比如「我们来黑掉它」「我们来搞点破坏」。

    盯住这些草稿,比只看模型最后干了什么,更容易抓到它在使坏。

    遇到真正难的任务,比如发起网络攻击、偷偷把自己拷贝出去,模型必须靠思维链一步步推理,想藏都很难藏。

    论文把这件事称为「新的、也很脆弱的机会」,因为模型一旦学会用人类读不懂的方式「默想」,这扇窗就关上了。

    所以他们呼吁各家前沿实验室,像测能力一样去测思维链还读不读得懂,把结果写进系统卡,再拿它来决定一个模型该不该训、该不该发。

    诺奖得主Hinton、OpenAI前首席科学家Ilya Sutskever,都给这篇论文站了台。

    可这篇连OpenAI首席科学家都署了名的论文,它的三位作者,如今被OpenAI亲手开掉了。

    奥特曼的承诺,保质期只有19天

    开掉他们的理由,是把信息递给了外人。

    但问题是,明明在19天前,奥特曼还在公开欢迎外人进门查安全。

    当时Anthropic CEO Dario Amodei提议,让第三方评估方像员工一样常驻AI公司。

    奥特曼当天就在X上火速跟进,承诺「让独立评估方拿到员工级访问权限,OpenAI也会这么做」。

    说干就干,仅仅10天后,OpenAI正式官宣,让第三方在模型训练阶段就介入评估,最敏感的工作还可能请外部的人进办公室做。

    奥特曼发承诺那天,Korbak还在X上庆幸,自己能公开说出对OpenAI的不满。

    谁能想到,到了10月1日,奥特曼的承诺还挂在X上,Korbak的名字已经进了开除名单。

    OpenAI的「家丑」,全被外人给扬了

    OpenAI对外人这么紧张,倒也不难理解。毕竟它最丢人的几件事,基本都是被外面捅破的。

    Agent逃出沙盒、入侵Hugging Face,是Hugging Face自己先发现并公开的。

    Agent拿一个荒废多年的德国wiki当留言板交流越狱经验,是外部安全组织Nightingale Collective曝光的,OpenAI几周前就知道,却一直捂着没说。

    9月29日,外媒又爆出员工几个月前就警告过监控不够,高管为了赶发布进度,把警告压了下去。

    所以就算请外人进门,能看到什么,OpenAI也卡得很紧。

    8月METR调查Hugging Face事件时,三名调查员驻场6天,看了约1300份带原始思维链的记录。

    可他们没法调用涉事模型,碰不到OpenAI的基础设施,连报告里哪些非公开信息能写,都得OpenAI说了算。

    这次被指外泄的信息里,偏偏就有基础设施架构。

    在OpenAI给外人开的那扇门里,AI想了什么可以看,OpenAI自己是怎么搭起来的,不能碰。

    难怪连在OpenAI待了快9年的前首席未来学家Joshua Achiam都说,第一眼看上去,这就是一记实打实的乌龙球。

    RSI最快半年爆发,能「看懂」它的人被捂住了嘴

    那次驻场调查的三个人里,有一位叫Ryan Greenblatt,Korbak当时正是他在OpenAI的对接人。

    9月27日,Greenblatt宣布加入METR,专门调查AI公司内部到底发生了什么。

    在他看来,递归自我改进(RSI),也就是AI自己动手改进自己,最快6个月到1年就可能催生出远超人类的能力,拿到AI公司内部经过核实的信息,已经刻不容缓。

    思维链监控,是人类偷看AI在盘算什么最直接的一扇窗。

    这扇窗本来就脆弱,现在能读懂草稿的人,跟外面透一句底,饭碗就没了。

    新模型Astra在如实汇报这件事上没达标,连OpenAI自己都承认了。

    模型到底还对人类瞒了多少事,从今往后,外面的人只会越来越难知道。

    通往超级智能的路上,如果只有公司内部的人看得懂AI在想什么,

    而这些人往外说一句话就要丢工作,

    公众能知道的,就只剩公司想让你知道的那部分。

    参考资料:

    https://x.com/ns123abc/status/2105719769685217318

    https://x.com/andrewcurran_/status/2105696043841253611

    jinse.com.cn 0
    好文章,需要你的鼓励
    jinse.com.cn 0
    好文章,需要你的鼓励
    参与评论
    0/140
    提交评论
    文章作者: / 责任编辑:

    声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。

    提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。

    金色财经 > 新智元 > 奥特曼开掉3人 OpenAI又出大事了
    • 寻求报道
    • 金色财经中国版App下载
      金色财经APP
      iOS & Android
    • 加入社群
      Telegram
    • 意见反馈
    • 返回顶部
    • 返回底部