肯定式安全:面向高风险人工智能的风险管理方法
计算机与社会
2024-06-25 v1 人工智能
摘要
多位人工智能专家建议,开发高风险人工智能系统的公司应在系统可开发或部署之前必须证明该系统是安全的。本文旨在扩展这一想法并探讨其对风险管理的影响。我们认为,开发或部署高风险人工智能系统的实体应被要求呈现肯定式安全证据:即主动证明其活动将风险控制在可接受阈值之下。本文开头概述了由人工智能专家和世界政府所认可的全球性人工智能安全风险。随后,我们简要描述了来自其他高风险领域(如核安全)的风险管理原则。然后,我们提出了一种针对先进人工智能的风险管理方法,要求模型开发者提供证据,证明其活动将某些风险控制在监管机构设定的阈值之下。作为理解肯定式安全案应包含哪些内容的第一步,本文说明了哪些技术证据和操作证据可支持肯定式安全案。技术部分讨论了行为证据(关于模型输出的证据)、认知证据(关于模型内部的证据)以及发展证据(关于训练过程的证据)。操作部分提供了某些组织实践示例,这些实践可能有助于肯定式安全案:信息安全实践、安全文化以及应急响应能力。最后,我们简要比较了本方法与 NIST 人工智能风险管理框架。总体而言,我们希望本工作有助于关于人工智能所带来的国家和全球安全风险以及如何解决这些风险的监管方法的 ongoing 讨论。
引用
@article{arxiv.2406.15371,
title = {Affirmative safety: An approach to risk management for high-risk AI},
author = {Akash R. Wasil and Joshua Clymer and David Krueger and Emily Dardaman and Simeon Campos and Evan R. Murphy},
journal= {arXiv preprint arXiv:2406.15371},
year = {2024}
}