AGI系统中的反事实规划
人工智能
2021-02-02 v1
摘要
我们提出反事实规划作为一种设计方法,用于创建一系列可应用于假设性未来具备通用人工智能(AGI)的AI系统的安全机制。反事实规划的关键步骤是使用AGI机器学习系统构建一个反事实世界模型,该模型被设计为不同于系统所处的真实世界。反事实规划智能体确定在此反事实规划世界中最大化期望效用的动作,然后在真实世界中执行相同动作。我们利用反事实规划构建了一个AGI智能体紧急停止按钮,以及一种将在智能体经历智能爆炸前自动停止该智能体的安全联锁装置。我们还构建了一个带有输入终端的智能体,人类可利用该终端迭代改进智能体的奖励函数,其中智能体操纵此改进过程的动机被抑制。作为非智能体AGI系统中反事实规划的示例,我们构建了一个反事实预言机。作为一种设计方法,反事实规划围绕使用图形符号定义数学反事实而构建。这种双图符号也为推理机器学习智能体内部典型存在的复杂自引用与间接表示类型提供了一种紧凑且可读的语言。
引用
@article{arxiv.2102.00834,
title = {Counterfactual Planning in AGI Systems},
author = {Koen Holtman},
journal= {arXiv preprint arXiv:2102.00834},
year = {2021}
}