中文

IL-flOw:基于归一化流的观测模仿学习

机器学习 2022-05-20 v1 人工智能 机器人学

摘要

我们提出了一种仅从专家状态观测进行逆强化学习(IRL)的算法。与最先进的对抗方法不同,我们的方法将奖励建模与策略学习解耦,后者需要在策略搜索期间更新奖励模型,并且已知不稳定且难以优化。我们的方法 IL-flOw 通过对状态-状态转移建模、使用在演示轨迹上训练的深度密度估计器生成奖励来恢复专家策略,从而避免了对抗方法的不稳定性问题。我们证明,使用状态转移对数概率密度作为前向强化学习的奖励信号可转化为匹配专家演示的轨迹分布,并通过实验展示了真实奖励信号的良好恢复以及在运动控制和机器人连续控制任务的观测模仿学习中达到当前最优结果。

关键词

引用

@article{arxiv.2205.09251,
  title  = {IL-flOw: Imitation Learning from Observation using Normalizing Flows},
  author = {Wei-Di Chang and Juan Camilo Gamboa Higuera and Scott Fujimoto and David Meger and Gregory Dudek},
  journal= {arXiv preprint arXiv:2205.09251},
  year   = {2022}
}

备注

Presented at the 4th Robot Learning Workshop at NeurIPS 2021