中文

寻求权力的 AI 是生存性风险吗?

计算机与社会 2024-08-14 v2 人工智能 机器学习

摘要

本报告审视了我认为关于错位人工智能带来生存性风险这一担忧的核心论证。我分两个阶段展开。首先,我铺陈一幅支撑此类担忧的背景图景。在该图景中,智能能动性是一种极其强大的力量,创造远比我们更智能的能动者无异于玩火——尤其是考虑到若其目标存在问题,此类能动者很可能具有寻求凌驾于人类之上权力的工具性动机。其次,我 formulate 并评估了一个更具体的六前提论证:创造此类能动者将在 2070 年前导致生存性灾难。该论证认为,到 2070 年:(1) 构建具有相关强大能力与能动性的 AI 系统将变得可能且经济上可行;(2) 将有强烈动机去这样做;(3) 构建对齐的(且具有相关强大能力/能动性的)AI 系统,远比构建错位的(且具有相关强大能力/能动性的)AI 系统但表面上仍具部署吸引力要困难得多;(4) 某些此类错位系统将以高影响方式寻求凌驾于人类之上的权力;(5) 该问题将扩展至人类完全丧失权力;(6) 此种丧失权力将构成生存性灾难。我对该论证各前提赋予粗略的主观置信度,最终得出到 2070 年发生此类生存性灾难的总体估计约 5%。(2022 年 5 月更新:自 2021 年 4 月公开本报告以来,我的估计已上升,现高于 10%。)

关键词

引用

@article{arxiv.2206.13353,
  title  = {Is Power-Seeking AI an Existential Risk?},
  author = {Joseph Carlsmith},
  journal= {arXiv preprint arXiv:2206.13353},
  year   = {2024}
}

备注

57 pages, 1 figure. Edited to fix link to audio version, add links to short version and reviews, and fix a typo in section 2.1.2