作为 $f$-散度最小化的模仿学习
机器学习
2020-06-02 v2 信息论
机器人学
math.IT
机器学习
摘要
我们解决具有多模态演示的模仿学习问题。我们认为,在许多任务中无需尝试学习所有模态,只需模仿其中任意一个即可。我们表明,由于损失函数的选择,GAIL 和行为克隆等最先进方法常常错误地在这些模态之间进行插值。我们的关键见解是最小化学习器与专家状态-动作分布之间的正确散度,即反向 KL 散度或 I-投影。我们提出了一种用于估计和最小化任意 f-散度的通用模仿学习框架。通过代入不同的散度,我们能够恢复现有算法,如行为克隆(Kullback-Leibler)、GAIL(Jensen Shannon)和 Dagger(Total Variation)。实证结果表明,我们的近似 I-投影技术能够比 GAIL 和行为克隆更可靠地模仿多模态行为。
引用
@article{arxiv.1905.12888,
title = {Imitation Learning as $f$-Divergence Minimization},
author = {Liyiming Ke and Sanjiban Choudhury and Matt Barnes and Wen Sun and Gilwoo Lee and Siddhartha Srinivasa},
journal= {arXiv preprint arXiv:1905.12888},
year = {2020}
}
备注
International Workshop on the Algorithmic Foundations of Robotics (WAFR) 2020