中文

基于偏好的深度贝叶斯奖励学习

机器学习 2019-12-11 v1 人工智能 机器学习

摘要

贝叶斯逆强化学习(IRL)方法对于安全模仿学习是理想的,因为它们允许学习智能体对奖励不确定性和所学策略的安全性进行推理。然而,贝叶斯 IRL 对于高维问题在计算上难以处理,因为后验中的每个样本都需要求解整个马尔可夫决策过程(MDP)。虽然存在非贝叶斯深度 IRL 方法,这些方法通常推断奖励函数的点估计,排除了严格的安全与不确定性分析。我们提出贝叶斯奖励外推(B-REX),一种高效的、基于偏好的贝叶斯奖励学习算法,可扩展到高维视觉控制任务。我们的方法利用后继特征表示与对演示的偏好,高效地从演示者奖励函数的后验分布中生成样本,而无需 MDP 求解器。利用后验样本,我们展示了在地面真值奖励函数未知的模仿学习设定中,如何计算策略性能的高置信界。我们在通过像素输入进行模仿学习来玩 Atari 游戏的任务上评估了所提方法,且无法访问游戏分数。我们证明 B-REX 学到的模仿策略可与仅学习奖励函数点估计的最先进深度模仿学习方法相竞争。此外,我们证明通过 B-REX 生成的后验样本可用于计算多种评估策略的高置信性能界。我们表明高置信性能界对于在奖励函数未知时准确排序不同评估策略是有用的。我们也证明高置信性能界可能有助于检测奖励黑客。

关键词

引用

@article{arxiv.1912.04472,
  title  = {Deep Bayesian Reward Learning from Preferences},
  author = {Daniel S. Brown and Scott Niekum},
  journal= {arXiv preprint arXiv:1912.04472},
  year   = {2019}
}

备注

Workshop on Safety and Robustness in Decision Making at the 33rd Conference on Neural Information Processing Systems (NeurIPS) 2019