从可信赖性视角看人工智能系统的保障
人工智能
2025-06-04 v3
摘要
我们概述了对构成重大风险的计算机系统进行经典保障的原则。随后,我们考虑将这些原则应用于采用人工智能(AI)和机器学习(ML)的系统。这种“可信赖性”视角的一个关键要素是要求透彻理解关键组件的行为,而这被认为对AI和ML是不可行的。因此,可信赖性视角旨在通过使用“纵深防御”策略,以一系列较不复杂的系统(其中一些可能是经过高度保障的常规工程组件)来“守护”AI和ML元素,从而最大限度地减少对它们的信任。这与寻求对AI和ML元素本身进行保障的“可信”视角形成对比。在信息物理系统及许多其他系统中,很难提供不依赖AI和ML来感知其环境的守护措施(例如,与自动驾驶汽车共享道路的车辆),因此两种视角都是必要的,并且它们之间存在一个连续体或谱系。我们聚焦于该连续体中偏向可信赖性一端的架构,并邀请其他研究者考虑该谱系上的其他点。对于需要使用AI和ML进行感知的守护措施,我们研究了最小化对这些元素信任的方法;这些方法包括多样性、纵深防御、可解释性以及微运行设计域(micro-ODDs)。我们还研究了在给定世界模型的情况下,强制执行可接受行为的方法。这些方法包括经典的信息物理计算与包络,以及基于总体原则、章程、伦理或声誉的规范性规则。我们将我们的视角应用于自主系统、特定功能AI系统、通用AI(如大型语言模型LLMs)以及通用人工智能(AGI),并提出了当前的最佳实践,最后以一项四重研究议程作为总结。
引用
@article{arxiv.2407.13948,
title = {Assurance of AI Systems From a Dependability Perspective},
author = {Robin Bloomfield and John Rushby},
journal= {arXiv preprint arXiv:2407.13948},
year = {2025}
}