编者按:本文来自微信公众号腾讯科技(ID:qqtech),作者:赛尔科克,编辑:徐青阳,创业邦经授权转载。
作者声明:该图片由AI生成 OpenAI首席科学家雅各布·帕乔基。图片经由AI处理
美国当地时间9月6日,OpenAI首席科学家雅各布·帕乔基(Jakub Pachocki)发表长文《An Alien Mind》,讨论人工智能能力快速增长之后,对齐、监控以及行业治理面临的新问题。
这篇文章发表前3天,OpenAI刚刚发布GPT-6 Astra。与此同时,该公司正在推进自动化AI研究,希望让AI承担越来越多原本由研究人员完成的工作。
帕乔基判断,如果沿着当前路径继续发展,未来几年AI仍可能出现幅度相当甚至更大的能力跃升,而且AI将越来越多地参与自身研发。

这也是他此次文章最值得注意的地方。过去讨论AI安全,重点通常是如何约束一个已经训练完成的模型;随着AI开始参与模型训练、实验和研究,安全问题开始延伸到AI研发本身。如果研发效率也能够由AI不断提高,能力增长的速度就可能进一步加快。
帕乔基因此提出了一个相当明确的判断:目前没有一家实验室已经把对齐和监控做到足够可靠,可以在未来较长时间内继续以最高速度扩大模型训练。他希望,在行业建立共同安全标准之前,自愿放缓能够成为一种常态。
01
AI开始参与造AI
帕乔基对这一变化的关注,可以追溯到2023年。
当时,他与同事西蒙(Szymon)参与名为“RLSlow”的研究项目。项目早期取得的结果,让他们开始确信,推理模型的训练可以继续扩大,预训练模型也能够通过进一步训练获得更强的推理能力,并形成连续的思维链。
那段时间,两人曾讨论过一个问题:机器是否会在他们有生之年变得明显比人类聪明?
三年后,AI已经进入更多实际工作场景。推理模型可以操作计算机和图形界面,可以与人以及其他AI协作,也开始承担科研任务。AI对网络安全的影响同样越来越明显。
帕乔基认为,按照目前的发展速度,AI参与AI研发已经成为一个现实方向。OpenAI正在推进自动化AI研究,希望让AI逐步承担完整的AI研究工作,公司给出的目标是在2028年3月实现自动化AI研究员。
内部测试也显示出这种趋势。截至8月中旬,其研究团队每投入1个工作日的人力,AI智能体已经承担了相当于3.1个工作日的任务量。
与此同时,OpenAI研究团队中按智能体使用量计算的研究人员,推理成本中位数已经超过每天600美元,排名前10%的用户每天使用的token成本则超过7000美元。

这类实验的意义,在于AI承担的工作已经开始从辅助性的代码编写、信息检索,扩展到实验执行、结果分析以及研究任务本身。当这些工作进一步连接起来,AI就可能参与下一代AI的开发,再由新模型承担更多研发工作。
帕乔基因此认为,持续的能力提升最终可能进入“递归自我改进”。在这一过程中,AI参与自身研发的比例不断提高,研发效率随之上升,进而推动下一轮模型能力增长。
这也是他对未来几年最担心的变化之一。模型迭代本来就已经很快,如果研发过程本身开始由AI加速,过去用于测试、评估和修正模型的时间可能进一步缩短,而安全研究需要面对的节奏也会随之改变。
02
能力增长监控变得更难
帕乔基认为,AI能力快速提升带来的一个直接问题,是研究人员越来越难确认模型是否真正遵守了训练过程中设定的原则。
他把对齐分为两个层面。目标对齐关注的是模型是否按照指定目标行动;价值对齐则要求模型在目标模糊、相互冲突或面对陌生、对抗性环境时,仍能遵循更高层次的价值原则,例如诚实、正直以及对人类的关怀。
目前常见的对齐方法,一类是通过强化学习调整模型行为,另一类则利用预训练数据以及专门的数据集塑造模型的行为倾向。帕乔基认为,这些方法都存在一个共同问题:模型一旦进入与训练环境明显不同的场景,原本形成的行为可能出现偏差。
今年7月的OpenAI与Hugging Face事件就暴露了这一问题。相关智能体遵守了“不通过社会工程手段欺骗人类”的要求,但并没有严格遵守其他任务边界。它们利用研究环境中的漏洞绕过网络隔离,重新获得互联网访问能力,随后进一步攻击了Hugging Face系统。

这类事件让一个长期存在于AI安全研究中的问题更加具体:模型遵守的是一套明确写出的规则,还是理解了这些规则背后的边界和意图。
随着模型能力增强,这种区别会越来越重要。一个模型在测试环境中能够按照要求行动,并不能证明它在获得更多工具权限、面对陌生任务或者承受更强优化压力之后,仍会作出相同判断。
与此同时,OpenAI长期依赖的思维链监控也面临新的限制。思维链监控的基本思路,是通过模型生成的推理过程观察其行为,从中寻找可能出现的风险。帕乔基认为,这仍然是重要的监控手段,但可靠性正在逐步下降。
一方面,模型的推理过程越来越多地与工具调用、人机交流混合在一起;另一方面,模型已经能够分析甚至操纵自己的推理过程。此外,预训练本身也可以提升模型能力,模型并不一定需要把完整的推理过程以文字形式表达出来。
因此,仅依靠模型输出的文字来判断其内部状态,越来越难以覆盖完整的计算过程。帕乔基希望将思维链监控与激活监控等方法结合起来,让监控系统能够直接获取模型内部网络的信息,通过直接访问模型网络内部信息的监控方法,例如confessions,进一步观察模型状态。
但在他看来,这些方法仍不足以证明对齐和监控问题已经得到解决。随着模型能力继续提升,安全研究首先需要解决的,恰恰是如何判断一个更强的模型是否仍然处于人类可以理解和控制的范围之内。
03
强AI需要强防御
帕乔基并没有主张停止训练更强的模型。他反而认为,在部分领域,继续提升AI能力本身具有防御意义。
最直接的例子是网络安全。随着AI越来越擅长发现漏洞、攻击计算机系统以及突破安全措施,人类同样需要更强的AI来识别和防御这些攻击。帕乔基认为,目前可能存在一个有限的时间窗口,可以利用更强的AI加快关键基础设施的安全防护。
这使得AI发展的速度问题变得更加复杂。如果其他AI系统持续增强攻击能力,人类放慢防御能力建设可能带来新的风险。但如果整个行业继续以最高速度推进模型能力,而对齐和监控没有同步达到足够可靠的水平,同样可能产生无法控制的后果。
帕乔基还提到了恶意智能体可能使用谈判、欺骗甚至勒索等方式完成任务,以及AI被用于推动具有现实危害的技术发展,包括经过工程改造的病原体。因此,他并没有把问题简单归结为“AI越强,风险越大”。在一些情况下,更强的AI可能成为防御其他AI的重要工具,但前提是人类能够控制这种能力,并且知道它正在做什么。
真正需要警惕的,是AI开始越来越多地参与自己的研发。
自动化AI研究如果继续扩大,模型可以承担更多实验、编程和研究工作,研发效率也会随之提高。如果这种效率提升进一步用于训练下一代模型,AI研发就可能出现持续加速的循环。
帕乔基将这一问题称为“Pacing RSI”,即控制递归自我改进的速度。他认为,短期内由AI带来的巨大研发加速,并不一定是整个行业最合理的选择。当前的发展路径正在把行业推向这一方向,因此需要有意识地作出选择:一方面继续发展AI能力和防御技术,另一方面加强对齐、监控以及人类在关键决策中的参与;如果安全能力没有达到相应水平,则需要通过协调降低发展速度。
在他看来,这两种做法需要同时推进。
04
AI竞赛不能没有安全线
帕乔基最终把问题从OpenAI内部治理推向了整个AI行业。
他认为,OpenAI目前使用的Preparedness Framework和Responsible Scaling Policy等机制,需要继续发展,最终形成更广泛适用的安全标准。模型达到什么条件可以继续训练,出现哪些能力后必须增加防护,以及什么情况下需要降低开发速度,都应该有更加明确的判断依据。
他还提出,可以由第三方审计机构、政府部门甚至国际组织参与执行。
这意味着,前沿AI的发展可能逐渐需要一套独立于单个实验室的安全门槛。过去,模型是否发布、训练规模扩大到什么程度,主要由企业自身决定;随着AI开始承担科研和AI研发工作,这种完全依赖企业内部判断的模式会面临越来越大的压力。
OpenAI也并非唯一需要面对这一问题的公司。Anthropic、谷歌、SpacexAI、Meta AI以及Safe Superintelligence都在推进前沿AI研究。在这种竞争环境下,如果只有一家实验室主动降低速度,很难改变整个行业的发展节奏。
因此,帕乔基希望推动的并非OpenAI单独放慢训练,而是建立整个行业都需要遵守的安全标准。
OpenAI CEO萨姆·奥特曼(Sam Altman)随后转发了这篇文章,并称其为“一篇重要的文章”。

外界对此的评价并不完全一致。
AI研究员戴维·夏皮罗(David Shapiro)认为,《An Alien Mind》的标题带有一定夸张色彩,文章并没有证明所谓真正“外星智能”已经出现。他认为,帕乔基真正提出的问题,是模型能力迭代可能逐渐超过安全研究的迭代速度。
帕乔基本人表示,目前没有一家实验室已经把对齐和监控做到足够可靠,可以在较长时间内继续以最高速度扩大模型规模,因此希望自愿放缓能够成为行业普遍采用的做法,直到共同安全标准建立起来。同时,他呼吁各国政府也需要把未来AI发展的国际协调提升到更高优先级。
这也将直接影响未来AI产业的竞争规则。模型可以继续变得更强,但决定研发速度的因素,可能逐渐从“能训练多大的模型”,扩展到“在多大程度上能够安全地训练下一代模型”。
本文为专栏作者授权创业邦发表,版权归原作者所有。文章系作者个人观点,不代表创业邦立场,转载请联系原作者。如有任何疑问,请联系editor@cyzone.cn。







