中文

模仿学习中的反馈:协变量偏移的三种机制

机器学习 2021-02-12 v2 机器人学 机器学习

摘要

模仿学习从业者经常注意到,将策略以先前的动作作为条件会导致“留出”误差与学习器在现场表现之间的显著背离。交互式方法可证明地解决这种背离,但需要重复查询示范者。近期工作将这种背离归因于预测当前动作时的“因果混淆”,并试图利用因果推断工具来消除当前状态的因果方面。在本文中,我们反而认为这种背离只是协变量偏移的另一种表现,尤其因决策与输入特征之间的反馈设置而加剧。学习器常常依赖于对决策有强预测性但遭受强协变量偏移的特征。我们的工作展示了一大类可在理论与实践中缓解此偏移的问题,其利用模拟器但无需进一步查询专家示范。我们分析了用于测试模仿学习方法的现有基准,发现这些基准是可实现且简单的,因此不足以捕捉真实世界决策问题中看到的更困难的误差复合机制。我们令人惊讶地发现,与先前文献相反但与我们的理论一致,朴素行为克隆提供了极佳的结果。我们详述了对捕捉机器人问题中现象的新标准化基准的需求。

关键词

引用

@article{arxiv.2102.02872,
  title  = {Feedback in Imitation Learning: The Three Regimes of Covariate Shift},
  author = {Jonathan Spencer and Sanjiban Choudhury and Arun Venkatraman and Brian Ziebart and J. Andrew Bagnell},
  journal= {arXiv preprint arXiv:2102.02872},
  year   = {2021}
}