人工智能不可接受风险阈值的建议
计算机与社会
2025-03-11 v1 人工智能
密码学与安全
人机交互
机器学习
摘要
前沿AI模型——处于AI发展前沿的高能力基础模型——在未来几年可能会对公共安全、人权、经济稳定和社会价值构成严重风险。这些风险可能源于蓄意的对抗性滥用、系统故障、意外的连锁反应或多个模型的同时失效。为应对此类风险,在2024年5月的AI首尔峰会上,16家全球AI行业组织签署了《前沿AI安全承诺》,27个国家和欧盟发表了关于界定这些阈值意图的宣言。为履行这些承诺,各组织必须确定并披露“阈值,在该阈值下,模型或系统构成的严重风险若未得到充分缓解,将被视为不可接受”。为协助设定和实施不可接受风险阈值,我们概述了关键原则和考量因素;例如,在快速发展的AI能力及随之演变的风险相关数据有限的情况下,力求设定“良好而非完美”的阈值。我们还针对八个风险类别中的部分风险提出了具体的阈值建议,包括一些详细的案例研究:(1) 化学、生物、放射性和核武器(CBRN),(2) 网络攻击,(3) 模型自主性,(4) 说服与操纵,(5) 欺骗,(6) 毒性,(7) 歧视,以及(8) 社会经济破坏。我们的目标是作为政策制定者和行业领导者的起点或补充资源,鼓励主动的风险管理,优先考虑在事前预防不可接受的风险,而不仅仅是在风险发生后进行缓解。
引用
@article{arxiv.2503.05812,
title = {Intolerable Risk Threshold Recommendations for Artificial Intelligence},
author = {Deepika Raman and Nada Madkour and Evan R. Murphy and Krystal Jackson and Jessica Newman},
journal= {arXiv preprint arXiv:2503.05812},
year = {2025}
}
备注
79 pages