中文

作为 $f$-散度最小化的模仿学习

机器学习 2020-06-02 v2 信息论 机器人学 math.IT 机器学习

摘要

我们解决具有多模态演示的模仿学习问题。我们认为,在许多任务中无需尝试学习所有模态,只需模仿其中任意一个即可。我们表明,由于损失函数的选择,GAIL 和行为克隆等最先进方法常常错误地在这些模态之间进行插值。我们的关键见解是最小化学习器与专家状态-动作分布之间的正确散度,即反向 KL 散度或 I-投影。我们提出了一种用于估计和最小化任意 f-散度的通用模仿学习框架。通过代入不同的散度,我们能够恢复现有算法,如行为克隆(Kullback-Leibler)、GAIL(Jensen Shannon)和 Dagger(Total Variation)。实证结果表明,我们的近似 I-投影技术能够比 GAIL 和行为克隆更可靠地模仿多模态行为。

关键词

引用

@article{arxiv.1905.12888,
  title  = {Imitation Learning as $f$-Divergence Minimization},
  author = {Liyiming Ke and Sanjiban Choudhury and Matt Barnes and Wen Sun and Gilwoo Lee and Siddhartha Srinivasa},
  journal= {arXiv preprint arXiv:1905.12888},
  year   = {2020}
}

备注

International Workshop on the Algorithmic Foundations of Robotics (WAFR) 2020