AI风险谱系:从危险能力到存在主义威胁
计算机与社会
2025-08-20 v1 人工智能
摘要
随着AI系统能力日益提升、集成度加强和普及范围扩大,理解其关联风险变得越来越重要。本文绘制了AI风险的完整谱系,从当前影响 individual 用户的伤害,到可能危及人类生存的存在主义威胁。我们将这些风险组织为三个主要因果类别:误用风险(当人们故意使用AI从事有害活动——制造生物武器、发动网络攻击、进行对抗性AI攻击或部署致命自主武器);误差风险(AI系统 pursuit 的结果与人类价值观相冲突,开发者意图如何无关紧要,这包括通过规格游戏(奖励黑客)、图谱不服从和追求长期战略目标中的权力寻求倾向所引发的风险);系统性风险(当AI融入复杂社会系统时,逐渐削弱人类自主性——权力集中、加速政治和经济失权、创建依赖导致人类衰弱,或不可逆地锁定当前价值观限制未来道德进步)。除上述核心类别外,我们识别出风险放大器——竞争压力、意外事件、企业冷漠以及协调失败——这些因素会使所有风险的发生概率和严重程度都提高。全文贯穿,将当今既存风险和可观察到的AI行为与合情合理的未来结果相连,展示现有趋势如何可能演变为灾难性结果。我们的目标是帮助读者理解AI风险的完整图景。美好的未来是可能的,但并非默认发生。应对这些挑战需要前所未有的协调,但如果我们能做好准备,精彩的未来正等待我们。
引用
@article{arxiv.2508.13700,
title = {The AI Risk Spectrum: From Dangerous Capabilities to Existential Threats},
author = {Markov Grey and Charbel-Raphaël Segerie},
journal= {arXiv preprint arXiv:2508.13700},
year = {2025}
}