中文

奖励函数差异的量化

机器学习 2021-03-19 v3 人工智能 机器学习

摘要

对于许多任务,奖励函数无法被内省或过于复杂而无法以过程方式指定,因此必须从用户数据中学习。先前的工作通过评估为所学奖励优化的策略来评估所学奖励函数。然而,这种方法无法区分是所学奖励函数未能反映用户偏好,还是策略优化过程未能优化所学奖励。此外,该方法只能告诉我们评估环境中的行为,但奖励即使在略微不同的部署环境中也可能激励非常不同的行为。为解决这些问题,我们引入了等效策略不变比较(EPIC)距离,以直接量化两个奖励函数之间的差异,而无需策略优化步骤。我们证明 EPIC 在总是诱导相同最优策略的奖励函数等价类上是不变的。此外,我们发现 EPIC 可以被高效近似,并且比基线对覆盖分布的选择更鲁棒。最后,我们表明 EPIC 距离即使在不同的转移动态下也能界定最优策略的遗憾,并且我们通过经验证实它预测策略训练的成功。我们的源代码可在 https://github.com/HumanCompatibleAI/evaluating-rewards 获取。

关键词

引用

@article{arxiv.2006.13900,
  title  = {Quantifying Differences in Reward Functions},
  author = {Adam Gleave and Michael Dennis and Shane Legg and Stuart Russell and Jan Leike},
  journal= {arXiv preprint arXiv:2006.13900},
  year   = {2021}
}

备注

Published at ICLR 2021. 9 pages main paper, 42 pages total