从孤岛到系统:面向AI系统的过程化危害分析
人工智能
2024-10-31 v1 人机交互
摘要
为有效应对AI系统可能带来的危害,识别和缓解系统级危害至关重要。当前的分析方法孤立地关注AI系统的单个组件,如训练数据或模型,忽视了组件交互或它们在公司开发流程中的定位所带来的危害。为此,我们借鉴了成熟的系统安全领域,该领域将安全性视为整个系统的涌现属性,而不仅仅是其组件。在本工作中,我们将系统理论过程分析(STPA)——一个公认的系统安全框架——转化应用于分析AI运行和开发过程。我们聚焦于依赖机器学习算法的系统,并对三个案例研究进行了STPA分析,涉及线性回归、强化学习和基于Transformer的生成模型。我们的分析探讨了STPA的控制和系统理论视角如何应用于AI系统,以及AI的独特特性——如模型不透明性、能力不确定性和输出复杂性——是否需要对框架进行重大修改。我们发现,进行STPA的关键概念和步骤可以直接应用,尽管需要针对AI系统进行一些调整。我们提出了面向AI系统的过程化危害分析(PHASE)指南,该指南将STPA概念适配于AI,使基于STPA的危害分析更易用。PHASE为负责管理AI系统危害的分析人员提供了四种关键能力:1) 检测系统级危害,包括由不同问题累积产生的危害;2) 明确承认导致算法危害体验的社会因素;3) 在危害与能够缓解危害的人员之间建立可追溯的责任链;4) 对新危害进行持续监控和缓解。
引用
@article{arxiv.2410.22526,
title = {From Silos to Systems: Process-Oriented Hazard Analysis for AI Systems},
author = {Shalaleh Rismani and Roel Dobbe and AJung Moon},
journal= {arXiv preprint arXiv:2410.22526},
year = {2024}
}