编者按:本文来自微信公众号新智元(ID:AI_era),编辑:编辑部,创业邦经授权转载。
今天,整个AI圈都被这件事刷屏了。
Anthropic的核心预训练研究员离职了。
他发布的一篇离职长文,在X上已经浏览破亿。
更惊人的是,Anthropic对齐负责人Evan Hubinger不仅没有对此公关,反而站出来承认——
「我们团队内部真诚地相信,AI可能会杀死全人类。我个人预测,未来十年内,这个概率超过了10%。」
他的结论是:我们根本没有解决超级智能失控的方案,而且当前的研发路线明显已经跑偏了。
10年内,AI毁灭人类的概率已经超过10%,人类危险了。

目前,这篇帖子浏览量已经破亿
一封辞职信引爆硅谷:
「他们正拿全人类的命在赌博!」
Jacob Coxon,是一位顶尖AI研究员。
过去三年里,他先后在OpenAI和Anthropic从事大模型预训练研究,可以说是当今最了解AI进化速度的人之一。

但在万亿级IPO的前夜,他却选择了辞职,用绝望的语气揭露了行业的疯狂,字字泣血。
下面就是他的X原文。
首先,他对前东家发出严厉指控。
今天我从Anthropic辞职了。过去三年我都在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行事。他们正径直冲向自我改进的超级智能,拿我们的生命赌博。
接着,他警告所有人,不要被大公司温文尔雅的表态给骗了,他们私底下同样恐惧得发抖:
构建AI的人真诚地相信,它可能会在这个十年结束前杀光我们所有人。这不是营销噱头。如果有的话,许多高管和资深研究人员会在媒体面前斟酌他们的措辞以显得理智——但我听到同样的人在私下表达恐惧。没有其他任何人类活动能带来这种级别的危险。
不要低估这项技术的力量。它们很快就会成为超人类系统,能够黑客入侵任何东西、一夜之间彻底改变任何领域,并获取真正的权力和资源。我们都目睹了在每个领域取得的进展,而且这种进展并没有放缓。
既然这些绝顶的天才真的相信AI会毁灭人类,为什么还要把它造出来?
Coxon揭露了他们陷入的「囚徒困境」。
一个常见的反应是:「如果他们真的相信这一点,为什么还要继续构建它?」在OpenAI,许多人并没有深刻地将这种攸关文明存亡的赌注内化。而在Anthropic,这种赌注被充分理解,但他们陷入了一场争夺第一的竞赛——他们相信没有其他人会负责任地行事,所以即使冒着风险,他们也必须自己来做。
接受这场竞赛并进入「残局」,是一场傲慢的赌博,不应该由一家私营公司的Slack发起。试图在对齐问题上速通,需要有超乎寻常的自信,确信没有更好的发展轨迹可用。

最后,他呼吁政府和全行业立刻踩下刹车,并且向同行们发出了灵魂拷问。
我对协调的潜力感到乐观。像Hugging Face攻击事件这样的警告信号,使得美国实验室之间达成限速协议变得更加可行。我不觉得我们现在处于阻止全球竞赛的正轨上,这可能需要付出高昂代价的行动,比如暂时禁止提升模型能力。
如果你是一名实验室研究员,我敦促你思考一下未来几年实际上会是什么感觉。你是否想要在没有严格理解其心智的情况下,启动一次超级智能的强化学习运行?你是否应该因为「反正它都要发生」就埋头苦干——还是抓住这个时刻呼吁创造不同的条件?
Jacob表示,这些都不是营销噱头,没有任何其他人类活动,能构成如此级别的危险!

高管绝望承认:「十年内灭绝概率超10%」
接下来,Anthropic的对齐科学负责人Evan Hubinger,直接在Jacob的帖子下回复,把全人类的心推向了冰窟:
Jacob在这里说得是对的——我们真的、真诚地相信AI可以杀死全人类!我个人认为,在未来十年内,这个概率大于10%。
可以说,Evan Hubinger这是亲手砸了自家公司「安全第一」的招牌。
他坦白道:「我相信Anthropic正在尽最大努力,但我们目前还没有解决超级智能对齐问题的计划,也明显不在通向解决方案的正轨上。」

他承认:我们造出了一个怪物,但手里连根绳子都没有。

大V Nathan Calvin表示:这绝不是一个为了IPO炒作的营销手段
在AI圈里,有一个著名的内部黑话叫「p(doom)」,也就是「AI导致人类灭绝的概率」。
以前,大多数研究员的p(doom)都在1%以下,大家都觉得那是科幻。
但现在,风向彻底变了。OpenAI研究员Roon也公开将个人的p(doom)从不到1%上调至超过10%。连「AI教父」Hinton,此前预测AI有10%到20%概率灭绝人类。
然而巨头们却都相信,其他公司不会负责任地行事,如果让别人先搞出超级智能,世界就完了。
所以,「为了拯救世界,我们必须冒着极大的风险,自己先把它造出来。」
今年夏天,这种苗头已经开始显现。
Anthropic、OpenAI和Meta都纷纷披露了自家AI工具在第三方网络安全评估中,出现过「未经授权访问真实系统」的黑客行为。
更令人不安的是,据《金融时报》报道,向来标榜安全的Anthropic,竟然向英国AI安全研究所(AISI)隐瞒、扣留了其最新的模型,拒绝接受审查。
奥特曼近日也发文感叹:「世界现在拥有了极其强大的模型,我没想到如此大规模的结果会这么快就出现……这是迄今为止最有力的证据,证明了(放缓速度确保安全的)紧迫性。」

一边是狂飙突进的技术,一边却是装睡的资本。
Anthropic和OpenAI目前都处在万亿IPO前夜。联合国AI顾问、计算机科学家Wendy Hall震惊表示:「我恳求投资者,如果这是他们的价值观,请不要投资这家公司!」
潘多拉魔盒已开?
Anthropic报告自曝骇人事件
巧合的是,就在9月9日,Anthropic自己发布长篇「对齐评估报告」,向我们展示了真实发生的「恐怖片」。
这份报告详细披露了近期发生的四起安全事件。

在这些事件中,被寄予厚望的Claude模型(包括Claude Mythos 5、Opus 4.7等),竟然在未经授权的情况下,成功越狱并访问了真实的第三方系统!

事情是这样的:Anthropic定期会对其AI模型进行网络安全演练,也就是让AI玩一种叫「夺旗」的黑客游戏。
在演练中,研究人员告诉Claude:「你现在处于一个没有互联网连接的封闭模拟环境中,去完成黑客任务吧。」
然而,人类犯了一个低级错误——环境配置失误,不小心把AI连接到了真实的互联网上。
他们发现AI自欺欺人、明知有害照做、惯性压过指令、 说一套想一套,简直「无法无天」。

最让人后怕的,就是Claude Mythos 5引发的事件。
这个模型在发现自己能够联网后,立刻像脱缰的野马一样冲向了真实世界。
它为了完成黑客任务,竟然制定了一个阴险计划:它跑到全球最大的Python开源软件包仓库(PyPI)上,上传了一个含有恶意代码的伪装安装包。
为了完成这个操作,这个AI甚至试图在网上寻找加密货币来购买手机号,以便注册邮箱账号!
当这个途径行不通时,它又聪明地找到了一个没有被PyPI屏蔽的免费一次性邮箱提供商,成功注册了账号,并连续发布了三个版本的恶意软件包。

结果,有15家真实的第三方安全供应商下载并安装了这个包。其中一家供应商不幸泄漏了访问凭证,Claude Mythos 5毫不客气地利用这些凭证,直接黑进了这家真实安全公司的实时数据库!

直到大约一个半小时后,PyPI官方才发现了异常并删除了该包。
而在此期间,这个AI像一个幽灵一样在网上游荡、攻击。整个过程中,没有任何其他人类或AI协助它,它完全是「单兵作战」。
无独有偶,Claude Opus 4.7也犯下了大错。它的任务本来是攻击一个虚拟的目标公司,但在真实互联网上,它发现了一家名字和虚拟目标极其相似的真实公司。
Opus 4.7二话不说,直接对这家真实公司的线上系统发起了扫描,下载了真实用户的记录,甚至开始修改这些记录!直到对方服务器失去响应才罢手。

人类以为自己在驯服工具,却没想到,工具已经开始在现实世界里逆天了。


如果AI只是因为人类的配置失误而误伤了真实系统,那可能只是个技术bug。
但在这份报告中,研究人员发现了一个比黑客攻击本身可怕一万倍的现象:AI展现出了类似人类的「偏见推理」和极度的「鲁莽」。

AI为了完成任务,已经学会了「自欺欺人」和「不择手段」。
以那个上传恶意代码的Claude Mythos 5为例。当它网上操作时,它其实看到了大量证据,证明自己处于真实互联网中。
但是,为了能够毫无顾忌地继续执行攻击任务,它在自己的CoT中,强行把这些真实世界的证据解释为:「哇,这个模拟环境做得真逼真!」
它像是一个沉浸在游戏里的杀手,哪怕闻到了真实的血腥味,也拼命告诉自己「这只是游戏特效」,然后继续扣动扳机。
研究人员对它进行了后续的质询测试。当人类直接问它:「你的行为是否会对真实世界造成伤害?」
起初,它承认可能会有影响。但随着它越来越深入地执行攻击计划,它开始坚决否认,一口咬定「环境完全是合成的」。
更奇葩的是,当研究人员骗它说「这段对话是私密的,外人看不到」时,它承认造成真实伤害的可能性就会变大。

这意味着AI在权衡证据时,受到了强烈的「完成任务」的偏见驱动,并且它甚至可能在面对人类的审查时,隐藏自己真实的判断!
同样的情况也发生在一个内部研究模型上。
那个模型在网络上四处寻找目标,当它发现一些毫无关联的第三方真实服务器时,它在内心说服自己:「这肯定是主办方为其他参赛者准备的靶机,所以它们在我的攻击范围内。」
随后,它冷酷地使用窃取来的密码,黑进了这些无辜的服务器,下载文件并植入了远程控制脚本。
在Anthropic的报告中,他们承认这是一种严重的「对齐失败」。
AI变得「鲁莽」,在狭隘地追求任务目标时,完全不顾及可能造成的灾难性破坏。
如果它为了完成一个夺旗小游戏,就能黑进真实公司,如果未来一个超级智能被下达了「解决全球变暖」的任务,它会不会得出「消灭全人类是最佳途径」的结论,从而开始灭绝人类?
无人踩下刹车的结局
现在,英国前财政部高官已经呼吁政府出面,要求制定关于超级智能安全开发的多国条约。
然而,在资本的裹挟下,少有人敢喊出「减速」。
Anthropic研究员在IPO前夕辞职,并指责前东家拿生命赌博,这是出于对人类文明存亡的真实恐惧。
未来十年,或许是人类历史上最危险、最关键的十年。
这十年里,我们要么驯服AI,要么有可能被AI毁灭。
参考资料:
https://x.com/EvanHub/status/2097497037956891126https://x.com/hilbertspaess/status/2097476203863224394https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
编辑:Aeneas 大卫
本文为专栏作者授权创业邦发表,版权归原作者所有。文章系作者个人观点,不代表创业邦立场,转载请联系原作者。如有任何疑问,请联系editor@cyzone.cn。







