中文

AI 对齐策略的风险视角:独立安全机制还是共享故障?

人工智能 2025-10-14 v1

摘要

AI 对齐研究旨在开发技术确保 AI 系统不会造成伤害。然而,每种对齐技术都有其失效模式,这些失效模式是存在技术失效以非可忽略概率提供安全性的条件。作为风险缓解策略,AI 安全社区越来越采用防御深度框架:承认没有单一技术能保证安全,防御深度包括拥有多个冗余的保护措施,以防护失效,使得即使某些保护失效,安全性仍能维持。然而,防御深度的成功取决于对齐技术之间失效模式的 (不)相关性。例如,如果所有技术都具有完全相同的失效模式,防御深度方法将毫无额外保护。本文分析了 7 个代表性对齐技术和 7 个失效模式,以了解它们之间的重叠程度。我们 then 讨论了这些结果对理解当前风险水平以及如何在未来优先考虑 AI 对齐研究的意义。

关键词

引用

@article{arxiv.2510.11235,
  title  = {AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures?},
  author = {Leonard Dung and Florian Mai},
  journal= {arXiv preprint arXiv:2510.11235},
  year   = {2025}
}

备注

under review