中文

使用逐步相对可达性惩罚副作用

机器学习 2019-03-11 v2 人工智能 机器学习

摘要

我们如何设计避免对环境造成不必要干扰的安全强化学习智能体?我们表明,当前惩罚副作用的方法会引入不良激励,例如阻止环境中任何不可逆变化,包括其他智能体的行动。为隔离此类不良激励的来源,我们将副作用惩罚拆解为两个组成部分:基线状态与偏离该基线状态的度量。我们认为其中部分激励源于基线的选择,另一些源于偏离度量的选择。我们引入逐步无作用基线的新变体,以及基于状态相对可达性的新偏离度量。这些设计选择的组合避免了上述不良激励,而更简单的基线与不可达性度量则失败。我们通过在设计用于说明可能不良激励的一组网格世界实验上比较基线与偏离度量选择的不同组合,对此进行了实证展示。

关键词

引用

@article{arxiv.1806.01186,
  title  = {Penalizing side effects using stepwise relative reachability},
  author = {Victoria Krakovna and Laurent Orseau and Ramana Kumar and Miljan Martic and Shane Legg},
  journal= {arXiv preprint arXiv:1806.01186},
  year   = {2019}
}