中文

带判别器的外在奖励软Q模仿学习

机器学习 2024-01-31 v1 人工智能

摘要

在奖励设计困难或奖励稀疏的环境中,模仿学习常被用作强化学习的补充,但仅凭少量专家数据和采样数据,很难在未知状态下进行良好模仿。行为克隆等监督学习方法不需要采样数据,但通常会遭受分布偏移。基于强化学习的方法,如逆强化学习和生成对抗模仿学习(GAIL),可以仅从少量专家数据中学习。然而,它们通常需要与环境交互。软Q模仿学习(SQIL)解决了这些问题,并证明其可以通过结合行为克隆和具有恒定奖励的软Q学习来高效学习。为了使该算法对分布偏移更具鲁棒性,我们通过向该方法添加一个基于对抗逆强化学习的奖励函数,该函数奖励智能体在与演示相似的状态下执行动作,从而提出了一种更高效、更鲁棒的算法。我们将此算法称为判别器软Q模仿学习(DSQIL)。我们在MuJoCo环境中对其进行了评估。

关键词

引用

@article{arxiv.2401.16772,
  title  = {Extrinsicaly Rewarded Soft Q Imitation Learning with Discriminator},
  author = {Ryoma Furuyama and Daiki Kuyoshi and Satoshi Yamane},
  journal= {arXiv preprint arXiv:2401.16772},
  year   = {2024}
}

备注

9 pages, 4 figures. arXiv admin note: text overlap with arXiv:2001.06808