中文

AI风险储存库:人工智能风险的元综述、数据库与分类学

人工智能 2026-05-06 v3 密码学与安全 新兴技术 机器学习 系统与控制 系统与控制

摘要

人工智能 (AI) 正在从视频生成到医学诊断,从编码代理到自动驾驶汽车等方面改变社会。然而,研究人员、政策制定者和科技公司缺乏关于 AI 风险的共同术语进行讨论。考虑到“隐私”这一概念:一个框架将其描述为模型泄露敏感训练数据之能力,而另一个框架则将其定义为来自政府监视的自由。相反,研究人员已引入“好哈特法则”、“规格游戏”、“奖励黑客”和“mesa 优化”等术语来描述 AI 系统针对测量的代理而非预期目标进行优化的同一现象。这种术语多样性造成了阻力:跨研究比较发现需要在框架之间进行映射,而全面覆盖风险则需要查阅使用不同组织原则的多个分类学。本文通过创建 AI 风险的综合目录来解决这一挑战。我们系统地分析了迄今为止发布的每个主要 AI 风险框架——共计 74 个框架包含 1,725 个独立风险——并将其组织成统一系统。我们的两大分类系统揭示了重要模式:与常见假设相反,人类决策导致的 AI 风险(38%)几乎与 AI 系统本身(42%)的风险相当。该工作为从开发人员进行风险评估到政策制定者编写法规再到审计师评估 AI 系统的人提供实用工具。通过建立共同的参考点,这个储存库为更有组织地管理 AI 的风险而实现其潜在收益奠定了基础。

关键词

引用

@article{arxiv.2408.12622,
  title  = {The AI risk repository: A meta-review, database, and taxonomy of risks from artificial intelligence},
  author = {Peter Slattery and Alexander K. Saeri and Emily A. C. Grundy and Jess Graham and Michael Noetel and Risto Uuk and James Dao and Soroush Pour and Stephen Casper and Neil Thompson},
  journal= {arXiv preprint arXiv:2408.12622},
  year   = {2026}
}

备注

This paper has been published in Patterns (Cell Press, 2026) under a CC BY 4.0 licence: https://doi.org/10.1016/j.patter.2026.101517