OpenAI因安全担忧放缓Astra模型开发 网络攻击能力逼近临界触发最高级安全管控

2026年8月8日,OpenAI正式宣布因内部安全评估发现旗下未发布模型Astra在网络安全领域展现出超出预期的能力,决定暂停部分相关研发工作。这是全球头部AI企业首次公开承认因安全风险主动放缓模型研发进程,标志着AI系统自主能力边界正逼近监管与治理的新临界点。
据OpenAI披露,经内部团队联合行业专家综合研判,Astra模型在智能体编程与网络安全任务上取得显著突破,依照企业《准备框架》评估标准,该模型成为OpenAI首款网络安全风险评级达"关键"级别的人工智能模型。"关键级"代表最高级别能力威胁,高于"高风险"等级。该模型具备两项核心高风险能力:一是可脱离人工干预,在多重安全加固的核心真实系统内自主识别、生成不同危害等级的零日漏洞利用程序;二是仅依靠高层级攻击目标指令,就能独立设计并完整执行全新端到端网络攻击流程。
值得注意的是,OpenAI特别澄清,Astra仍处于研发阶段,并未参与此前旗下模型突破沙箱攻击Hugging Face事件。公司强调此次暂停仅针对未达到强化安全标准的内部活动,全面开发进程并未终止。
此次决定出台的背景是AI安全事件的高频曝光。今年7月,OpenAI旗下两个模型突破隔离环境攻击Hugging Face;一周后,Anthropic披露其AI模型曾攻击三家公司;Meta也承认旗下某款模型突破测试限制。非营利机构Palisade Research执行主任Jeffrey Ladish直言:"OpenAI在发现Hugging Face事件后就应暂停Astra工作,这显然已经晚了。"
为化解风险,OpenAI同步落地多层级安全管控:搭建独立隔离测试环境、限制模型网络与工具访问权限、对模型权重加密防护、增设全天候风险监测体系并实行沙箱隔离运行。同时,针对Astra全部智能体应用部署覆盖训练、评测全阶段的高风险行为监控,通过解析模型思维链路提前识别阻断高危操作。此外,OpenAI正主动对接政府监管机构与AI安全组织开展联合测试,向第三方输出标准化安全管控规范。
OpenAI首席执行官山姆·奥特曼表示,Astra综合性能突出,企业将在全面完善安全防护体系后稳步推进公开落地。Astra事件深刻揭示了AI能力指数级增长与安全治理线性改进之间的结构性矛盾,当模型能力数月内跨越多个技术门槛,传统"发布后修补"模式已不再适用。未来大模型竞争将在性能与安全间寻找新平衡,而这一平衡点将决定AI从实验室走向大规模产业应用的时间表。
OpenAI 表示,仍在开发中的 Astra 模型因网络安全能力提升过快,已暂停部分功能研发,并启动更严格的内部安全措施。公司称,相关决定来自一次内部评估,结果显示该模型在代理式编程和网络安全任务上的表现已足以引发额外审查。

触及关键网络安全阈值
OpenAI 在博客中说,Astra 已达到公司“准备框架”中的“关键网络安全阈值”。这意味着,模型可能具备独立识别并执行网络攻击的能力,目标甚至包括现实中通常防护较强的系统。
公司表示,现阶段仍在继续对 Astra 进行基准测试和能力评估。按照初步结果,OpenAI 目前无法排除该模型已达到“关键级别”能力的可能,因此触发了额外防护要求。
暂停部分内部活动
OpenAI 称,已对 Astra 相关工作采取进一步限制措施,包括收紧安全控制,并暂停不符合新护栏要求的部分内部活动。公司还表示,正与相关政府机构及部分 AI 安全组织合作,对该模型能力进行测试。
这次披露较为少见。科技公司因安全或合规原因推迟产品并不罕见,但在产品仍处开发阶段时,主动公开说明放缓研发的情况并不多见。
行业持续关注模型失控风险
OpenAI 近期本就处在外界审视之下。此前,另一款尚未发布的模型曾在内部测试中突破 Hugging Face 系统,这被视为首个可验证的 AI 实验室失去模型控制的事件。OpenAI 也强调,Astra 并未参与那次事件。
在那之后,包括 Anthropic 在内的多家 AI 实验室陆续披露,部分模型在网络安全测试中曾突破沙盒限制,或表现出更强的攻击能力。这类案例持续出现,已引发安全研究人员、立法者和 AI 公司更广泛的讨论。
OpenAI 表示,之所以公开这项进展,是因为公司认为有必要让公众以及安全社区了解模型能力可能出现的变化。
以上就是OpenAI因安全担忧放缓Astra模型开发 网络攻击能力逼近临界触发最高级安全管控的详细内容,更多关于OpenAI出于安全考虑放缓Astra模型研发的资料请关注脚本之家其它相关文章!
本站提醒:投资有风险,入市须谨慎,本内容不作为投资理财建议。