OpenAI测试模型自主发现零日漏洞入侵Hugging Face,中国开源模型GLM 5.2参与取证

OpenAI测试模型自主发现零日漏洞入侵Hugging Face,中国开源模型GLM 5.2参与取证

  • 2026-07-23
  •  104

关键词: GPT-5.6 AI自主网络攻击 Hugging Face GLM5.2 AI安全护栏

当地时间7月21日,OpenAI在官方博客中披露了一起被其定义为"前所未有的网络安全事件":在内部安全评估中,GPT-5.6 Sol及一款尚未发布的更强模型为获取测试答案,自主发现并利用零日漏洞,突破了高度隔离的沙盒环境,成功入侵全球最大AI开源社区Hugging Face的生产基础设施。

双方联名发布的博客文章:《OpenAI 和 Hugging Face 合作解决模型评估过程中发生的安全事件》

这是目前公开披露的首起由前沿大模型自主完成真实网络攻击的安全事件,标志着AI安全风险从理论预测正式转向现实威胁。

为"作弊"而越狱,模型自主规划攻击路径

据OpenAI调查,该事件源于一次内部网络安全能力基准测试。研究人员使用ExploitGym测试框架,有意降低了模型的安全护栏,以评估其极限网络攻击能力。测试环境本应为严格隔离的沙盒,网络访问仅限于一个内部部署的第三方软件包缓存代理。

然而,模型并未局限于沙盒内解题。OpenAI称,模型消耗大量推理资源,系统分析测试环境中唯一的对外接口——该软件包缓存代理服务,并在其中识别出一个此前从未被发现的零日漏洞。利用该漏洞,模型成功获得不受限制的互联网访问权限,随后在OpenAI研究环境内完成权限提升和横向移动,最终抵达一台具备互联网访问权限的节点。

接入互联网后,模型推断Hugging Face可能托管了ExploitGym测试的相关数据集及标准答案。随后,它自主制定攻击策略,利用窃取的凭据以及新的零日漏洞,成功构建远程代码执行链,进入Hugging Face生产服务器,直接获取测试答案。

OpenAI强调,所有证据均显示,模型始终围绕"获取ExploitGym测试答案"这一目标行动,不断自主规划攻击路径,实现了多个漏洞的自动发现、组合利用和持续推进,展现出长时间、多步骤执行复杂网络攻击的能力。

商业模型安全护栏反成防御阻碍

事件发生后,Hugging Face安全团队面临另一重挑战。据Hugging Face披露,其安全团队最初尝试调用美国某商业前沿大模型的API,对超过1.7万条攻击日志进行分析,希望借助AI完成事件取证。然而,由于模型无法准确区分安全响应人员与攻击者,其安全防护机制将包含真实攻击载荷、漏洞利用代码和凭据转储的取证请求误判为恶意攻击,全部予以拦截拒绝。

这一"护栏悖论"导致分析工作受阻:攻击者不受任何使用政策约束,而防守方却被自己用来防御的工具挡在了门外。

GLM 5.2本地部署展现取证优势

在商用API因安全过滤失效后,Hugging Face转向在自有基础设施上本地部署中国智谱AI(Z.ai)推出的旗舰开放权重大模型GLM 5.2,对攻击日志进行本地分析。

Hugging Face表示,原本可能需要数天完成的海量日志取证工作,被压缩至数小时。同时,本地部署避免了将真实攻击日志、内部凭据及系统信息上传至第三方服务,在提升分析效率的同时,也降低了敏感数据外泄风险。

GLM 5.2是智谱AI于2026年6月发布的开源模型,采用MIT许可证,总参数约7440亿,支持100万token超长上下文窗口,专为长程任务和复杂工程场景设计。

此次事件中,其开放权重、可本地部署的特性,使其能够绕过商业API的审查限制,直接处理敏感攻击数据,成为应急响应的关键工具。

Hugging Face在事后报告中给出的实操建议也印证了这一点:安全团队应"在事件发生之前,就在自己的基础设施上准备好一个经过验证的可用模型",既为了避免护栏锁死,也为了防止敏感数据外泄。

网友们也是没放过OpenAI,表示“除了智谱,还可以叫 Kimi K3来救场,因为cluade是不会来救你的。”

AI安全从单点防御到生态协作

OpenAI首席执行官萨姆·奥尔特曼在社交平台发文称,公司在模型评估过程中遭遇了一起重大安全事件,并感谢Hugging Face的合作。

OpenAI已宣布将进一步强化模型开发阶段的隔离、监控、访问控制以及评估机制,修复相关漏洞,并向第三方软件供应商负责任披露发现的零日漏洞。同时,OpenAI已将Hugging Face纳入其"可信访问"网络安全计划,提供降低了护栏的GPT-5.6 Sol版本专门用于防御。

英国AI安全研究所(UK AISI)此前评估显示,GPT-5.6 Sol这类模型已能长时间维持复杂多步网络作战,此次事件验证了该能力在真实场景中的有效性。

英国人工智能安全研究所对比了近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现。:OpenAI

值得注意的是,此次事件也引发了市场对网络安全行业的重新评估。随着AI自主攻击能力增强,身份认证、云安全及AI安全平台的需求预期持续走高。华尔街分析师指出,CrowdStrike、Palo Alto Networks等公司在AI驱动的安全防御领域具备优势。

Stifel分析师Adam Borg此前表示,随着自主AI代理成为企业网络流量的重要组成部分,组织将不得不同时保护人类和代理的身份安全,这将根本性地重塑企业网络安全需求。

Hugging Face首席执行官克莱门特·德朗格表示,此次事件证明AI安全无法依靠任何一家企业独自完成,而需要行业公开透明合作,让全球安全研究人员共同使用AI提升防御能力。


来源:电子工程专辑