中文

可参数化重定目标的决策者倾向于寻求权力

人工智能 2022-10-13 v2

摘要

如果有能力的人工智能体普遍被激励去为其被指定的目标而寻求权力,那么这些系统除巨大益处外还将带来巨大风险。在完全可观测环境中,大多数奖励函数具有通过保持选项开放和存活来寻求权力的最优策略。然而,真实世界既非完全可观测,训练出的智能体也未必近似奖励最优。我们考虑一系列AI决策模型,从最优到随机,再到由学习并与环境交互所告知的选择。我们发现许多决策函数是可重定目标的,且可重定目标性足以引发寻求权力的倾向。我们的函数判据简单且宽泛。我们表明一系列定性相异的决策过程会激励智能体寻求权力。我们通过推理Montezuma's Revenge中学习到的策略激励来展示我们结果的灵活性。这些结果表明一种安全风险:最终,可重定目标的训练过程可能训练出凌驾于人类之上的真实世界寻权智能体。

关键词

引用

@article{arxiv.2206.13477,
  title  = {Parametrically Retargetable Decision-Makers Tend To Seek Power},
  author = {Alexander Matt Turner and Prasad Tadepalli},
  journal= {arXiv preprint arXiv:2206.13477},
  year   = {2022}
}

备注

10-page main paper, 36 pages total, poster at NeurIPS 2022