中文

通过迭代改进效用函数实现 AGI 智能体安全

人工智能 2020-07-13 v1

摘要

尽管目前仍不清楚能否构建出具有通用人工智能(AGI)的智能体,我们已可利用数学模型来研究这些智能体的潜在安全系统。我们提出了一种 AGI 安全层,其创建一个专用的特殊输入终端,以支持对 AGI 智能体效用函数的迭代改进。开启该智能体的人类可使用此终端来填补效用函数在编码智能体目标与约束时所发现的漏洞,引导智能体朝向新目标,或强制智能体自我关闭。AGI 智能体可能产生操纵上述效用函数改进过程的涌现动机,例如通过欺骗、限制甚至攻击相关人类。安全层将部分且有时完全抑制这一危险动机。本文第一部分推广了早期关于 AGI 紧急停止按钮的工作。我们旨在通过将数学方法应用于 MDP 模型,使构建该层所用的方法更易于理解。我们讨论了安全层的两条可证明性质,并展示了将其映射到因果影响图(CID)的进行中工作。第二部分中,我们给出了完整的数学证明,并表明安全层产生了一种官僚式盲目性。随后我们提出了一个学习智能体的设计,该设计将安全层包裹于已知机器学习系统或未来潜在的 AGI 级学习系统之外。所得智能体自首次开启起即满足可证明安全性质。最后,我们展示了如何将该智能体从其模型映射到实际实现,审视了此步骤涉及的方法论问题,并讨论了这些问题的典型解决方式。

关键词

引用

@article{arxiv.2007.05411,
  title  = {AGI Agent Safety by Iteratively Improving the Utility Function},
  author = {Koen Holtman},
  journal= {arXiv preprint arXiv:2007.05411},
  year   = {2020}
}

备注

Part 1 of this work is a preprint of a conference paper to appear in: Proceedings of the 13th International Conference on Artificial General Intelligence (AGI-20), Springer LNAI 12177 (2020). Part 2 has additional, new research results that go beyond those in the conference paper