中文

PAGAR:用主角-反派引导对抗奖励抑制基于逆强化学习模仿学习中的奖励错位

机器学习 2024-02-08 v3

摘要

许多模仿学习(IL)算法采用逆强化学习(IRL)来根据专家演示的行为推断其隐式优化的内在奖励函数。然而在实践中,由于推断出的奖励与任务目标之间的错位,基于 IRL 的 IL 可能无法完成底层任务。在本文中,我们通过引入一种称为主角-反派引导对抗奖励(Protagonist Antagonist Guided Adversarial Reward, PAGAR)的半监督奖励设计范式,来解决 IL 对此类错位的敏感性问题。基于 PAGAR 的 IL 训练策略在混合奖励函数下表现良好,而非像基于 IRL 的 IL 那样仅在单一奖励函数下。我们确定了基于 PAGAR 的 IL 能够避免由奖励错位导致任务失败的理论条件。我们还提出了一种实用的同策-离策(on-and-off policy)方法来实施基于 PAGAR 的 IL。实验结果表明,我们的算法在复杂任务和具有挑战性的迁移设定下优于标准 IL 基线。

关键词

引用

@article{arxiv.2306.01731,
  title  = {PAGAR: Taming Reward Misalignment in Inverse Reinforcement Learning-Based Imitation Learning with Protagonist Antagonist Guided Adversarial Reward},
  author = {Weichao Zhou and Wenchao Li},
  journal= {arXiv preprint arXiv:2306.01731},
  year   = {2024}
}