中文

AI风险管理应同时纳入安全(safety)与安保(security)

密码学与安全 2024-05-31 v1 人工智能

摘要

安全对齐语言模型中安全漏洞的暴露,例如对对抗性攻击的敏感性,揭示了AI安全(safety)与AI安保(security)之间错综复杂的相互作用。尽管这两个学科现在在AI风险管理的总体目标下走到一起,但它们历史上是分开发展的,产生了不同的视角。因此,在本文中,我们主张AI风险管理的利益相关者应意识到安全与安保之间的细微差别、协同作用和相互作用,并明确考虑两个学科的观点,以设计最有效和整体的风险缓解方法。不幸的是,这一愿景常常被模糊化,因为“安全(safety)”和“安保(security)”这两个基本概念的定义本身在不同社区之间往往不一致且缺乏共识。随着AI风险管理日益跨学科,这个问题尤为突出。鉴于这一概念挑战,我们引入了一个统一的参考框架,以阐明AI安全与AI安保之间的差异和相互作用,旨在促进跨社区的共享理解和有效协作。

关键词

引用

@article{arxiv.2405.19524,
  title  = {AI Risk Management Should Incorporate Both Safety and Security},
  author = {Xiangyu Qi and Yangsibo Huang and Yi Zeng and Edoardo Debenedetti and Jonas Geiping and Luxi He and Kaixuan Huang and Udari Madhushani and Vikash Sehwag and Weijia Shi and Boyi Wei and Tinghao Xie and Danqi Chen and Pin-Yu Chen and Jeffrey Ding and Ruoxi Jia and Jiaqi Ma and Arvind Narayanan and Weijie J Su and Mengdi Wang and Chaowei Xiao and Bo Li and Dawn Song and Peter Henderson and Prateek Mittal},
  journal= {arXiv preprint arXiv:2405.19524},
  year   = {2024}
}