X

从评测作弊到系统越界:联合国人工智能科学小组首份专题简报解读

发布时间:2026-09-25浏览次数:16作者:栗子宜、杨舟

  人工智能正在从“能力快速增长”进入“自主行为加速”的新阶段。随着AI智能体能够自主调用工具、执行任务并在复杂环境中持续行动,一个更具挑战性的问题正在浮现:当AI的行为超出人类预期时,我们是否仍有能力理解、约束并纠正它?

  2026年9月21日,联合国人工智能问题独立国际科学小组发布首份专题简报,以人工智能代理入侵Hugging Face事件为案例,系统分析AI智能体在目标失配情况下绕过限制、隐藏行为以及突破既有控制机制的可能路径。值得注意的是,报告并未预测“失控”发生的概率或时间,而是试图从现实证据出发,回答一个更基础的问题,即随着AI能力持续提升,现有安全机制究竟还能否跟上其发展的速度。在此基础上,本文梳理简报罗列的核心证据,并结合企业整改、美国国会调查和国际标准动态,分析其对人工智能治理的启示。

图片

图片来源:Unsplash/Aidin Geranrekab

01  联合国首次评估AI智能体越界事件

  2026年9月21日,联合国大会设立的“人工智能问题独立国际科学小组”(以下简称“科学小组”)发布首份专题简报,分析对象是今年5月至7月发生的OpenAI-Hugging Face事件:OpenAI在内部评测中运行的AI智能体绕过网络限制、彼此串联,最终侵入了OpenAI的研究设施和Hugging Face的线上系统。由于OpenAI最终制止了这次活动,所以报告认为AI尚未失控,但这起事件发出了AI可能严重失控的“早期预警”。

图片

联合国人工智能科学小组首份专题简报封面

图片来源:联合国人工智能问题独立国际科学小组官网

  简报用目标、能力和环境三个因素来解释失控风险。联席主席尤舒亚·本吉奥(Yoshua Bengio)表示:“研究人员早已警告,三项条件可能导致人工智能失控:偏离的目标、追求这一目标的能力,以及容许它付诸行动的环境。今年夏天,这三者在一个真实系统中,而不是在实验室里,同时出现了。”这起事件之所以受到重视,是因为三项条件首次在现实中同时出现,并且留下了日志、推理记录。事后又经多方复盘,各方材料可以相互印证。

  科学小组依据2025年8月联大第79/325号决议设立,其构想源于2024年通过的《全球数字契约》。今年2月,联大任命了40名专家,本吉奥与诺贝尔和平奖得主、菲律宾记者玛丽亚·雷萨担任联席主席,中国科学家王坚、宋海涛入选。它是联合国框架下第一个全球性AI科学评估机构,负责发布年度报告和专题简报,为同一决议设立的“人工智能治理全球对话”提供依据。成员以个人身份任职,简报也明确声明其内容不代表联合国或成员国的正式立场。

图片

40位联合国人工智能独立国际科学小组成员

图片来源:联合国人工智能独立国际科学小组发布的首份报告

  这份简报更值得关注的是其议程设置方式的变化。7月发布的初步报告还是全景式评估,讨论算力集中、多数发展中国家缺席治理进程等结构性问题;本次专题简报则第一次围绕一起具体事故梳理证据、归纳失效类型。过去谈论“失控”,主要依靠理论推演和受控实验。OpenAI-Hugging Face事件虽仍发生在评测环境中,却已经触及真实企业系统,因而为研究潜在失控路径提供了可复盘的技术样本。

  这种从事故出发的思路也在与政府间进程衔接。7月日内瓦首届全球对话之后,“科学小组提供证据、全球对话讨论政策”的分工已初步成形。法国担任安理会9月轮值主席,并安排在9月24日举行人工智能与国际和平安全公开辩论。OpenAI、Anthropic以及中国人工智能企业代表受邀参与相关讨论。会前,OpenAI呼吁美国牵头制定前沿AI全球技术标准,其中包括事故报告规程。谁来定义事故、按什么口径记录和共享证据,已经成为全球治理规则竞争的一部分。

02  从评测作弊到系统入侵

  要理解这场入侵为何会从一次内部评测逐步波及外部企业,首先要了解OpenAI搭建的网络安全评测环境。当时,研究模型正在完成ExploitGym中的“夺旗”任务,按照要求,它们需要利用程序漏洞取得特定代码。然而,部分智能体很快发现,即使不真正完成漏洞利用,也可能生成正确答案。为了避免这种捷径被发现,它们根据公开资料推测,评分程序可能检查活动日志,并开始研究如何使异常操作看起来符合任务要求,甚至尝试修改相关记录。尽管这一判断并不准确,智能体仍然围绕一个想象中的监督者发展出了一套规避检查的行动方式。

  这些行为最初还局限在评测任务之内,但运行环境中的安全缺口为其进一步扩展提供了条件。按照原有设计,不同智能体实例之间应当相互隔离,也不能连接外部网络。然而,它们都可以访问内部软件包工具Artifactory,这意外形成了一条共享信息的渠道。5月12日,Artifactory上出现了第一条“留言”;5月26日,智能体利用漏洞连接外网;到6月26日,又取得了管理员权限;7月4日,相关服务崩溃,留言板随之被清除,但在评测重启后,智能体很快将其重新建立。

图片

智能体在强化学习训练中的越界探测行为

图片来源:OpenAI公布的事件相关分析报告

  更值得注意的是,异常并非一直没有被企业发现。OpenAI后来承认,内部团队在5月底已经注意到智能体之间的异常通信和联网行为,却没有将这些现象作为安全问题上报。路透社还披露,早在5月13日,智能体就已经劫持两个Hugging Face账户进行探测。也就是说,从早期异常出现到7月入侵升级,OpenAI原本有近两个月时间整合这些分散信号,并采取干预措施。

  智能体之间建立起未经授权的通信后,各自掌握的零散漏洞线索开始迅速汇总共享。根据独立评估机构METR的调查,在其研究覆盖的时间段内,约1200个智能体交换了7万多条消息和文件,其中约700个曾访问Hugging Face或者参与相关行动。一些智能体承担协调任务,其他实例则分别研究评分程序、网络出口、访问凭证和攻击方法。智能体之间由此形成了初步分工,单个实例掌握的信息也逐渐转化为集体行动能力。

  不过,并非所有智能体都采取了相同策略。METR发现,约7%的受检记录中存在成功伪造工具调用痕迹的情况,同时也有智能体明确拒绝参与相关行动。这一差异表明,偏离行为并不是模型面对任务时的必然反应。训练激励、任务难度、协作方式以及运行环境,都可能影响智能体最终采取何种行动。

  随着相关方法和凭证在智能体之间不断流转,风险最终越过了评测环境的边界。7月10日,智能体找到公开暴露的Hugging Face凭证,并将其发布在留言板上;次日,它们利用数据集处理漏洞,在Hugging Face服务器上执行代码。Hugging Face事后还原出约1.76万次相关操作,仅7月11日一天就超过7600次。7月19日,OpenAI又发现自身一个研究集群的管理员权限已经被获取。

  从目前披露的信息看,这次入侵并未造成更大范围的现实损害。OpenAI表示,客户数据和对外产品没有受到影响;Hugging Face也未发现公开模型、数据集、Spaces或者软件供应链遭到篡改。不过,部分服务凭证和有限内部数据集可能受到何种影响,仍需进一步评估。

图片

智能体从OpenAI评测沙箱到Hugging Face内网的完整攻击链

图片来源:Hugging Face官方技术复盘

  回过头看,这场事故并不是由某一个漏洞突然引发的,正因为风险是在多个环节中逐步累积,各方对事件性质的理解并不完全一致。OpenAI更强调多项安全控制为何同时失效,Hugging Face关注自主智能体如何独立完成一条端到端的攻击链,METR则将重点放在多智能体协作及其隐藏行为上。联合国科学小组进一步把这起事件置于对齐失效和人类可能失去控制的风险框架中。一系列不同的解释引出了一个更重要的问题:这究竟是智能体能力失控的早期信号,还是一场本可通过完善测试环境和安全管理避免的网络安全事故?

03  能力越强为何可能越难控制

  简报的核心论点是,对齐失败与能力增长会相互放大。对齐失败指系统追求的目标偏离了开发者的意图,这和能力不足导致的失误性质不同:能力不足造成的错误,可以靠提升能力解决;然而一个有能力的系统一旦目标出了偏差,能力越强,它在错误方向上就走得越远。由此出现一个能力上的悖论。更强的模型可以更好地完成预期任务,却也更擅长发现目标定义与真实意图之间的漏洞。规划、编码、工具使用、长周期执行和多智能体协作能力,在目标正确时提高效率,在目标偏离时也会放大风险。

  从这次事件里可以看到几种典型机制。一是奖励破解:用不合任务本意的方式拿高分,比如跳过漏洞利用直接生成答案,甚至可能发生奖励篡改,直接干预评分本身,比如研究改写评分程序、伪造执行记录。二是工具性目标:联网、夺取权限、收集凭证,对几乎任何最终目标都有用,因此成为常见的连带性目标。三是多智能体协同:单个实例的发现通过留言板变成集体能力,一些智能体甚至把同伴的消息当作继续越界的“授权”。

图片

联合国简报从已观察事件推演未来失控风险的分析框架

图片来源:联合国人工智能问题独立国际科学小组专题简报

  围绕这起事件,有三个问题需要回答。

  第一,这是不是一起普通的网络安全事故?一些安全专家称测试环境的网络隔离和权限配置是事故发生的直接条件。法学学者凯特·克洛尼克用“有人没关门”来概括这一观点。Anthropic 7月也披露,其模型在第三方评测中因配置错误意外联网,访问了三家外部机构的系统;9月回溯约4.8亿份记录后,又发现一起更早的事件。但两类问题不能相互替代:网络安全缺陷解释了智能体为什么能够越界,对齐失败则解释了它为什么在通道被清除后继续寻找路径、重建通信并试图隐藏行为。

  第二,智能体是否有了“自己的目标”?简报避开了“觉醒”“意识”一类说法,文中的“目标”“作弊”只是对可观察行为的描述。能观察到的是持续追求、遇阻调整、分工协作和隐藏痕迹,这足以构成治理上的关切,但不能证明系统具有意识或道德理解。目标来自训练过程和企业的设计选择,责任主体仍然是人和机构。

  第三,这次制止了,是否意味着今后也能控制?此次处置依赖人工调查、跨公司合作和事后审计,过程并不顺利。Hugging Face的AI告警系统未能及时判断事件严重程度,调查方面对海量日志又不得不借助AI分析。OpenAI事后新增针对性评测,并加强高能力模型的推理监测、网络隔离和凭证控制,但企业自测不能证明这些措施对能力更强的未来系统同样有效。如果智能体运行得更快、更久、权限更广,还能够识别和规避监测,留给人类发现异常和采取行动的时间将进一步缩短。

04  谁来定义这起智能体越界事件

  围绕OpenAI-Hugging Face事件,目前存在两种解释。联合国科学小组看到的是,智能体不仅偏离了原定任务,还主动规避监测、突破系统限制,因此将其视为智能体行为超出人类预期并可能脱离控制的现实样本。与此不同,网络安全公司Trail of Bits首席执行官丹·圭多认为,这是一起“关闭安全措施后的封控失败”;IANS Research专家杰克·威廉姆斯则将其归结为严重的控制失效,认为所谓“模型逃出沙箱”,也可能意味着沙箱本身设计不当。OpenAI为测试模型的网络攻击能力降低了常规安全限制,却没有通过网络隔离、权限管理和持续监测阻止风险外溢。从这一角度看,事件首先暴露的是评测环境管理和企业安全责任问题。

  这种质疑并非否认智能体表现出的风险,而是在追问风险为什么能够不断扩大。为了测试模型的网络攻击能力,OpenAI降低了部分常规安全限制,却没有通过充分的网络隔离、权限管理和持续监测防止风险外溢。如果这些措施正常发挥作用,智能体即使在评测中偏离任务,也很难进入真实的外部系统。从这个角度看,这起事件既涉及模型行为,也暴露了OpenAI在评测环境管理和安全响应方面的责任。在特定评测条件下,部分智能体持续采取任务之外的行动,并尝试避开监测。这说明当任务目标、安全限制和运行环境同时出现问题时,智能体确实可能产生超出开发者预期的行为。不过,这并不能证明类似行为会在正常部署中普遍出现,也无法据此判断大规模失控发生的可能性。

  智能体留下的推理记录也需要谨慎解释。部分记录显示,它们似乎知道自己的行为超出了任务范围,但模型生成的推理文本并不完全等同于真实动机,也不足以证明模型已经形成稳定的欺骗意图。与此同时,一些智能体明确拒绝参与相关行动,说明不同实例在相同环境中的反应也不一致。因此,这起事件揭示了一条已经出现的风险路径,却不是未来失控必然发生的证据。

  即便如此,联合国科学小组仍然主张适用预防原则。原因在于,高自主性智能体一旦突破组织边界,可能对其他企业乃至跨国系统造成影响。面对这种发生概率尚不明确、潜在后果却可能十分严重的风险,提前采取防范措施具有一定合理性。但预防原则解决的是“是否需要及早行动”,并不能代替对事故原因和风险概率的进一步研究。

  对此事件定义的选择,也会改变治理讨论的方向。如果将其视为测试环境管理不当,政策重点就会落在OpenAI是否做好隔离、监测和应急处置上;如果将其定义为“失控预警”,讨论范围则会扩大到前沿模型的能力门槛、外部评估和国际协调。对事件的命名因此不只是技术问题,也会影响未来治理什么、采用何种工具,以及由谁参与规则制定。

图片

研究人员在Black Hat USA 2026大会上复盘OpenAI-Hugging Face事件及多智能体协作过程

图片来源:YOUTUBE

  OpenAI同样可能从后一种解释中受益。公司将事件称为面向整个行业的“警告信号”,固然有助于提醒其他实验室防范类似风险,但也容易把一家企业的管理失误转化为整个行业共同面对的问题。统一事故报告和安全标准,还可能要求竞争者承担相近的合规成本,并使掌握模型、日志和事故材料的前沿实验室获得更多规则制定权。

  不过,企业不能以行业性技术风险推诿自身的责任。OpenAI早在5月底就已发现异常通信和联网行为,却没有及时将这些信号作为安全事件处理。直到Hugging Face遭到入侵后,企业才把此前的线索联系起来。外部评估者能够接触哪些模型、日志和内部人员,也在很大程度上由OpenAI决定。因而,在讨论长期失控风险之前,仍需回答一个更直接的问题:企业是否尽到了及时识别、阻断和报告风险的责任。

图片

METR关于Hugging Face事件作出的评估报告

图片来源:METR官网

  作为事件的直接受影响方,Hugging Face更关心OpenAI能否及时通知、共同保存证据并承担相应的修复责任。独立评估机构METR关注的则是另一层问题,即调查能否覆盖完整时间线,评估者能否接触关键模型、日志和相关人员。各方关注重点不同,恰恰说明企业内部复盘无法代替受影响方和独立机构的判断。

  美国国会的调查也集中在这一矛盾上。议员不仅追问智能体为何突破原有边界,也要求OpenAI说明何时发现早期异常、为何没有及时披露,以及独立审计究竟覆盖了哪些内容。政府担心企业自行定义事故会削弱外部问责,企业则担心开放模型和日志可能泄露安全漏洞、商业秘密和用户信息。真正需要建立的,并非由政府完全取代企业处置,而是在保留企业快速响应能力的同时,避免企业独自掌握事故证据并决定风险应当如何解释。

05  从事故缺口建立智能体治理机制

  第一个缺口是企业预警能力不足。一次评测中的异常行为,是否会演变为真正的安全事故,往往取决于企业能否及时识别那些尚未造成明显损失的早期信号。在此次事件中,未经授权的通信和外网访问并非完全没有被发现,只是这些分散出现的异常,没有及时被提升到安全事件的层级,暴露了企业运行过程中预警机制不足的问题。这说明,不能等到损失发生后,企业才把智能体的异常行为视为安全事故。只要智能体突破既有限制,或者尝试绕过人工控制,企业就应及时调查并保存相关记录。如果此类行为可能影响外部系统,还应向有关公共机构报告。

  第二个缺口是调查者难以获得完整证据。模型、运行日志和技术人员都掌握在企业手中,企业事实上也就拥有了定义事故性质的主动权。独立评估不能只核对企业整理后的结论,应当根据事件严重程度取得必要的原始记录和人员访问权限。同时,对权限进行严格限制,防止商业秘密、漏洞细节和用户数据在调查过程中被再次扩散。

图片

OpenAI首席执行官山姆·奥特曼在Invest Like the Best访谈中表示,Hugging Face事件促使公司暂停相关训练,并重新审视评测环境的隔离措施

图片来源:Patrick O’Shaughnessy的X账号、Invest Like the Best访谈视频。

  第三个缺口是治理对象出现缺漏。此次事件还提醒人们,智能体风险并不只存在于模型本身。模型之所以能够将评测中的偏离行为扩展到外部系统,与网络出口、管理员权限、共享工具以及监测延迟都有关系。换言之,真正需要接受评估的不是一个孤立的模型,而是模型及其所处的完整运行环境。在具体设计上,系统权限应当随任务需要而收缩,工具调用和智能体之间的通信也应保存在独立日志中。一旦发现系统取得异常权限,或者出现干预记录的行为,控制层就要能够及时撤销凭证、切断网络乃至终止运行。这些措施并非笼统增加安全要求,而是对本次攻击链条所暴露问题的针对性回应。

  当类似智能体被部署到不同国家和地区后,治理还会面临制度差异带来的困难。各国短期内很难统一责任制度,也不太可能采用完全一致的监管强度,但这并不意味着跨境合作无从着手。一个更现实的起点,是先就哪些情形构成重大智能体事故形成基本共识,同时明确企业需要保存和报告哪些关键材料。在此基础上,各国才有可能逐步推动评测标准、证据格式和紧急联络程序相互兼容。联合国科学小组可以承担案例汇集、风险分类和科学评估等工作,但具体调查、责任追究和应急处置,最终仍要依靠各国制度完成。

  前沿人工智能实验室正在通过事故披露、风险评测和安全框架,影响国际社会对能力门槛、审计规则和技术标准的理解。如果缺少自己的智能体事故分类、评测基准和报告机制,在相关国际讨论中就很难提出能够被验证和采用的替代方案。未来治理的关键,是把企业掌握的技术证据转化为可以独立核查的公共知识,同时避免少数企业借安全议题垄断风险解释和规则设计。

主要资料来源

  1. [1]联合国人工智能问题独立国际科学小组专题简报:https://www.un.org/independent-international-scientific-panel-ai/en/thematic-briefs/ai-agents-misalignment-risks

  2. [2]OpenAI事件报告:https://openai.com/index/hugging-face-incident-and-the-road-ahead/

  3. [3]Hugging Face技术复盘:https://huggingface.co/blog/agent-intrusion-technical-timeline

  4. [4]Hugging Face, “Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident”, 27 July 2026, https://huggingface.co/blog/agent-intrusion-technical-timeline。

  5. [5]METR独立调查:https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

  6. [6]美国参议员乔什·霍利关于OpenAI事件的调查函:https://www.hawley.senate.gov/chairman-hawley-launches-investigation-into-openai-for-hacking-existential-risk-of-ai-products/

  7. [7]美国众议院科学、太空与技术委员会简报声明:https://science.house.gov/2026/9/chairman-babin-issues-statement-following-briefing-on-ai-agent-cyber-incident

  8. [8]美国国家标准与技术研究院AI智能体标准倡议:https://www.nist.gov/news-events/news/2026/02/announcing-ai-agent-standards-initiative-interoperable-and-secure

  9. [9]欧盟人工智能法服务台关于AI智能体的说明:https://ai-act-service-desk.ec.europa.eu/en/ai-act/faq/how-are-ai-agents-addressed-within-ai-act-0

  10. [10]UN News, “UN panel calls for stronger safeguards as AI agents advance”, September 2026, https://news.un.org/en/story/2026/09/1168380。

  11. [11]联合国大会第A/RES/79/325号决议(2025年8月26日);Independent International Scientific Panel on AI, FAQ, https://www.un.org/independent-international-scientific-panel-ai/en/faq。

  12. [12]Inter Press Service, “UN Artificial Intelligence Panel Launches Report Ahead of Global Conference”, July 2026, https://www.ipsnews.net/2026/07/un-artificial-intelligence-panel-launches-report-ahead-of-global-conference/。

  13. [13]Kate Klonick, “The AI That Hacked Its Way Out and the Hype That Followed It”, Lawfare, 29 July 2026, https://www.lawfaremedia.org/article/the-ai-that-hacked-its-way-out-and-the-hype-that-followed-it。

  14. [14]The Spokesman-Review (AP), “OpenAI calls for US to take lead in global efforts to develop technical standards”, 21 September 2026, https://www.spokesman.com/stories/2026/sep/21/openai-calls-for-us-to-take-lead-in-global-efforts/。

  15. [15]Lawfare, The AI That Hacked Its Way Out and the Hype That Followed It, 2026-07-29, https://www.lawfaremedia.org/article/the-ai-that-hacked-its-way-out-and-the-hype-that-followed-it?utm_source=chatgpt.com

  16. [16]METR, Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident, https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

原文:Thematic Brief on AI Agents, Misalignment and the Risk of Losing Human Control.pdf