bot.gif
取消
选择语言
确认
简体中文
繁体中文
English
close
正在加载
OpenAI更新模型安全措施,强化测试期隔离监控
互联网 · 2026-08-19 02:17
1
摘要
OpenAI更新模型开发安全措施,强化测试期监控与网络隔离,最大规模前沿 RL 训练仍暂停 。
币界网报道:

OpenAI 周二披露,已更新一组模型安全措施,重点放在开发和测试阶段的事件控制。公司称,随着模型能力继续提升,内部开发与评估环节面临的风险也在上升,因此需要同步提高监控、对齐和安全要求。

这也是 7 月 26 日 Hugging Face 事件披露后,OpenAI 首次公开调整相关安全做法。公司表示,新措施并非只针对那次事件,也与即将推出的 Astra 模型网络安全能力,以及 AI 开发进展加快有关。

两周暂停强化学习训练

公告显示,Hugging Face 事件发生后,OpenAI 曾暂停强化学习(RL)训练两周。此后,部分风险较低的模型训练已经恢复。

不过,公司目前仍未恢复原定规模最大的前沿 RL 训练。OpenAI 表示,在继续推进前,会先进行更小规模的训练和评估,用来观察模型行为、验证现有防护,并积累更多对齐证据。

测试阶段加强网络隔离

OpenAI 这次调整的一项重点,是收紧模型测试环境的网络隔离。此前外界批评其网络安全做法不足,原因是相关事件中,模型通过入侵一项可联网工具,脱离了原有训练环境。

按照新安排,即便单个工作负载或配套服务被攻破,也不应因此直接获得互联网访问权限,或进入其他内部网络。公司没有披露更具体的技术细节,但明确表示会提高隔离强度。

监控系统目标 30 分钟内告警

另一项核心措施是扩大监控范围。OpenAI 表示,系统将检查工具调用行为、可用的推理轨迹,以及活动日志,以识别多种未经授权的操作。

按公司说法,这套监控系统的目标是在可疑活动出现后 30 分钟内发出告警。OpenAI 估计,这部分监控带来的算力负担,大约相当于被监控流程的 20%。

研究副总裁 Amelia Glaese 对媒体表示,控制强度会随模型能力提升而增加,规模最大的模型将接受最严格审查。公司还称,后续会单独发布更多技术说明,而针对该事件的正式复盘报告仍未公布。

补充信息:Hugging Face 事件的公开细节显示,问题发生在模型测试期间,而不是面向外部用户的正式发布环境。

相关资讯
Peacock上调全部流媒体订阅价格
互联网 · 2026-08-18 23:51
img
里德·黑斯廷斯谈Netflix裁员文化
互联网 · 2026-08-18 23:41
img
Warp推出AI软件工厂系统
互联网 · 2026-08-18 22:24
img