中文

R²AI:迈向演化世界中的抗性与韧性人工智能

机器学习 2025-09-09 v1

摘要

在这篇立场论文中,我们探讨了快速增长的人工智能能力与滞后的安全进展之间持续存在的差距。现有范式分为“使人工智能安全”,即应用事后对齐和防护栏,但依然脆弱且被动;以及“制造安全的人工智能”,强调内在安全,但难以应对开放式环境中的不可预见风险。因此,我们提出“通过协同演化实现安全”,作为“制造安全的人工智能”范式的一种新表述,其灵感来源于生物免疫,其中安全成为一个动态、对抗且持续的学习过程。为了落实这一愿景,我们引入了 R2^2AI——抗性与韧性人工智能——作为一个实用框架,将针对已知威胁的抗性与应对不可预见风险的韧性结合起来。R2^2AI 整合了快慢安全模型、通过安全风洞进行的对抗模拟与验证,以及引导安全与能力协同演化的持续反馈回路。我们认为,该框架为在动态环境中维持持续安全提供了一条可扩展且主动的路径,能够应对人工智能向通用人工智能和超级人工智能迈进过程中的近期漏洞和长期存在风险。

关键词

引用

@article{arxiv.2509.06786,
  title  = {\texttt{R$^\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World},
  author = {Youbang Sun and Xiang Wang and Jie Fu and Chaochao Lu and Bowen Zhou},
  journal= {arXiv preprint arXiv:2509.06786},
  year   = {2025}
}