AI安全:攀登至灾难的路径?
人工智能
2024-06-04 v2
摘要
本文提出一种论点,认为某些AI安全措施不仅未能缓解存在主义风险,反而可能加剧其危害。在若干关键假设下——AI必然失败、AI系统在失败时其权力与导致的危害程度呈正相关,以及安全措施倾向于在失败之前使AI系统变得更强大——安全措施的预期效用为负。本文检讨了三种响应策略:乐观主义、缓解和整体主义。每种策略都面临来自AI安全环境内固有特征的挑战,这些特征我们称为瓶颈、完美之壁和均衡波动。论证的意外鲁棒性迫使我们重新审视围绕AI安全的核心假设,并指向若干进一步研究方向。
引用
@article{arxiv.2405.19832,
title = {AI Safety: A Climb To Armageddon?},
author = {Herman Cappelen and Josh Dever and John Hawthorne},
journal= {arXiv preprint arXiv:2405.19832},
year = {2024}
}
备注
20 page article