中文

量化高自动化 AI 系统中的自动化风险:基于贝叶斯框架的失效传播与最优监督

人工智能 2026-02-24 v1

摘要

金融、医疗、交通、内容 moderation 和关键基础设施领域的组织正在快速部署高度自动化的 AI 系统,但缺乏原则方法来量化随着自动化水平提高导致损害扩大的程度。我们提出了一种简洁的贝叶斯风险分解,表达预期损失为三个术语的乘积:系统失效的概率、失效在给定自动化水平下转化为损害的条件概率,以及损害的预期严重程度。该框架隔离了一个关键量 — — 失效转化为损害的条件概率 — — 这一量捕捉执行和监督风险,而不仅仅是模型准确性。我们发展了完整的理论基础:分解的形式证明、损害传播等价定理将损害传播概率与可观察执行控制关联,风险弹性度量,自动化政策的有效前沿分析,以及具有二阶条件的最优资源分配原则。我们通过 2012 年骑士资本事件($440M 损失)的一个示范案例作为广泛适用的失效模式的一个实例,来说明该框架,并描述了在部署领域中大规模实证验证该框架所需的研究设计。该工作为一类以部署为导向的 AI 系统风险治理工具提供了理论基础。

关键词

引用

@article{arxiv.2602.18986,
  title  = {Quantifying Automation Risk in High-Automation AI Systems: A Bayesian Framework for Failure Propagation and Optimal Oversight},
  author = {Vishal Srivastava and Tanmay Sah},
  journal= {arXiv preprint arXiv:2602.18986},
  year   = {2026}
}