前沿 AI 风险管理框架实践:一项风险分析技术报告
人工智能
2025-07-29 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
为理解和识别快速发展的人工智能 (AI) 模型所带来的前所未有的风险,本报告对其前沿风险进行了全面评估。基于 Frontier AI Risk Management Framework (v1.0) (SafeWork-F1-Framework) 中的 E-T-C 分析 (部署环境、威胁来源、赋能能力),我们识别出七个关键风险领域:网络攻击、生物与化学风险、说服与操纵、 uncontrolled 自主 AI 研发、战略欺骗与策划、自我复制与联合。遵循“AI- 法则”,我们使用“红线”(不可接受阈值)和“黄线”(早期警示指标)来定义风险区域:绿色(可管理风险,适用于常规部署和持续监控)、黄色(需要加强缓解措施和受控部署)、红色(需要暂停开发和/或部署)。实验结果表明,所有最近的前沿 AI 模型均位于绿色和黄色区域,且未触及红线。具体而言,没有任何评估模型跨越网络攻击或 uncontrolled AI 研发风险的黄线。对于自我复制及战略欺骗与策划,大多数模型保持在绿色区域,仅有少数推理模型位于黄色区域。在说服与操纵方面,大多数模型位于黄色区域,因为其对人类的影响效果显著。在生物与化学风险方面,我们无法排除大多数模型位于黄色区域的可能性,尽管需要进行详细的威胁建模和深入评估才能进一步作出判断。本工作反映了我们对 AI 前沿风险的当前理解,呼吁集体行动以缓解这些挑战。
引用
@article{arxiv.2507.16534,
title = {Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report},
author = {Shanghai AI Lab and : and Xiaoyang Chen and Yunhao Chen and Zeren Chen and Zhiyun Chen and Hanyun Cui and Yawen Duan and Jiaxuan Guo and Qi Guo and Xuhao Hu and Hong Huang and Lige Huang and Chunxiao Li and Juncheng Li and Qihao Lin and Dongrui Liu and Xinmin Liu and Zicheng Liu and Chaochao Lu and Xiaoya Lu and Jingjing Qu and Qibing Ren and Jing Shao and Jingwei Shi and Jingwei Sun and Peng Wang and Weibing Wang and Jia Xu and Lewen Yan and Xiao Yu and Yi Yu and Boxuan Zhang and Jie Zhang and Weichen Zhang and Zhijie Zheng and Tianyi Zhou and Bowen Zhou},
journal= {arXiv preprint arXiv:2507.16534},
year = {2025}
}
备注
97 pages, 37 figures