中文

基于动力学无关判别器集成的可迁移奖励学习

机器学习 2024-06-27 v2

摘要

从专家示范中恢复奖励函数是强化学习中的基本问题。恢复出的奖励函数捕捉了专家的动机。智能体可通过在其环境中遵循这些奖励函数来模仿专家,即所谓学徒学习。然而,智能体可能面临与示范不同的环境,因此需要可迁移的奖励函数。经典的奖励学习方法如逆强化学习(IRL)或等价的对抗模仿学习(AIL),恢复出的奖励函数与训练动力学耦合,难以迁移。以往的动力学无关奖励学习方法依赖于诸如奖励函数必须为仅状态形式等假设,限制了其适用性。本工作中,我们在AIL框架内提出一种动力学无关判别器集成奖励学习方法(DARL),能够学习仅状态和状态-动作两类奖励函数。DARL通过将奖励函数与训练动力学解耦,在源自原始状态-动作空间的潜空间上采用动力学无关判别器来实现这一点。该潜空间被优化以最小化关于动力学的信息。此外,我们发现AIL框架存在降低可迁移性的策略依赖问题。DARL在训练中将奖励函数表示为判别器集成以消除策略依赖。在动力学改变的MuJoCo任务上的实证研究表明,DARL能更好地恢复奖励函数,并在迁移环境中取得更好的模仿性能,可处理仅状态与状态-动作奖励两种情形。

关键词

引用

@article{arxiv.2206.00238,
  title  = {Transferable Reward Learning by Dynamics-Agnostic Discriminator Ensemble},
  author = {Fan-Ming Luo and Xingchen Cao and Rong-Jun Qin and Yang Yu},
  journal= {arXiv preprint arXiv:2206.00238},
  year   = {2024}
}