中文

通过决策论对手揭示 AGI/ASI 的阿喀琉斯之踵

人工智能 2023-04-04 v9

摘要

随着人工智能(AI)研究的持续进展,了解先进系统将如何做出选择以及它们可能在哪些方面失效十分重要。机器在某些领域已经能够胜过人类,而理解如何安全地构建可能具备人类水平或以上能力的系统尤为令人关切。有人或许会认为,人工通用智能(AGI)与人工超级智能(ASI)将是人类无法可靠智胜的系统。作为对这一假设的挑战,本文提出阿喀琉斯之踵假说,即即便一个潜在的超级智能系统,仍可能具有稳定的决策论错觉,导致其在对抗性环境中做出非理性决策。通过对决策论文献中若干关键困境与悖论的调查,我们在此假说背景下讨论了若干此类潜在的阿喀琉斯之踵。我们为理解这些弱点可能被植入系统的方式做出了若干新颖贡献。

关键词

引用

@article{arxiv.2010.05418,
  title  = {Achilles Heels for AGI/ASI via Decision Theoretic Adversaries},
  author = {Stephen Casper},
  journal= {arXiv preprint arXiv:2010.05418},
  year   = {2023}
}

备注

Contact info for author at stephencasper.com