中文

前沿AI风险管理框架实践:风险分析技术报告 v1.5

人工智能 2026-02-17 v1 计算与语言 计算机视觉与模式识别 计算机与社会 机器学习

摘要

为理解和识别快速发展的人工智能(AI)模型所带来的前所未有的风险,《前沿AI风险管理框架实践》(Frontier AI Risk Management Framework in Practice)全面评估了其前沿风险。随着大型语言模型(LLM)通用能力的快速演进以及具身AI的普及,本版本风险分析技术报告提供了对五个关键维度的最新细粒度评估:网络攻击、说服与操纵、战略欺骗、未受控制的AI研发以及自我复制。具体而言,我们引入更为复杂的网络攻击情景。对于说服与操纵,我们评估了LLM之间说服的风险。对于战略欺骗与欺骗,我们新增了关于新兴错位(emergent misalignment)的实验。对于未受控制的AI研发,我们聚焦于智能体在自主扩张其记忆子strate与工具集(toolsets)过程中的“误演化”(mis-evolution)。我们还监控并评估了OpenClaw在Moltbook交互中的安全性能。对于自我复制,我们引入了资源受限情景。更重要的是,我们提出并验证了一系列稳健的风险缓解策略,为前沿AI的安全部署提供了初步的技术性可操作路径。本工作反映了我们对AI前沿风险的当前理解,呼吁集体行动以缓解这些挑战。

关键词

引用

@article{arxiv.2602.14457,
  title  = {Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5},
  author = {Dongrui Liu and Yi Yu and Jie Zhang and Guanxu Chen and Qihao Lin and Hanxi Zhu and Lige Huang and Yijin Zhou and Peng Wang and Shuai Shao and Boxuan Zhang and Zicheng Liu and Jingwei Sun and Yu Li and Yuejin Xie and Jiaxuan Guo and Jia Xu and Chaochao Lu and Bowen Zhou and Xia Hu and Jing Shao},
  journal= {arXiv preprint arXiv:2602.14457},
  year   = {2026}
}

备注

49 pages, 17 figures, 12 tables