OpenAI 周二披露,已更新一组模型安全措施,重点放在开发和测试阶段的事件控制。公司称,随着模型能力继续提升,内部开发与评估环节面临的风险也在上升,因此需要同步提高监控、对齐和安全要求。
这也是 7 月 26 日 Hugging Face 事件披露后,OpenAI 首次公开调整相关安全做法。公司表示,新措施并非只针对那次事件,也与即将推出的 Astra 模型网络安全能力,以及 AI 开发进展加快有关。
两周暂停强化学习训练
公告显示,Hugging Face 事件发生后,OpenAI 曾暂停强化学习(RL)训练两周。此后,部分风险较低的模型训练已经恢复。
不过,公司目前仍未恢复原定规模最大的前沿 RL 训练。OpenAI 表示,在继续推进前,会先进行更小规模的训练和评估,用来观察模型行为、验证现有防护,并积累更多对齐证据。
测试阶段加强网络隔离
OpenAI 这次调整的一项重点,是收紧模型测试环境的网络隔离。此前外界批评其网络安全做法不足,原因是相关事件中,模型通过入侵一项可联网工具,脱离了原有训练环境。
按照新安排,即便单个工作负载或配套服务被攻破,也不应因此直接获得互联网访问权限,或进入其他内部网络。公司没有披露更具体的技术细节,但明确表示会提高隔离强度。
监控系统目标 30 分钟内告警
另一项核心措施是扩大监控范围。OpenAI 表示,系统将检查工具调用行为、可用的推理轨迹,以及活动日志,以识别多种未经授权的操作。
按公司说法,这套监控系统的目标是在可疑活动出现后 30 分钟内发出告警。OpenAI 估计,这部分监控带来的算力负担,大约相当于被监控流程的 20%。
研究副总裁 Amelia Glaese 对媒体表示,控制强度会随模型能力提升而增加,规模最大的模型将接受最严格审查。公司还称,后续会单独发布更多技术说明,而针对该事件的正式复盘报告仍未公布。
补充信息:Hugging Face 事件的公开细节显示,问题发生在模型测试期间,而不是面向外部用户的正式发布环境。