中文

基于反向模型对少量演示的鲁棒模仿

机器学习 2022-10-19 v1 人工智能

摘要

对专家演示的行为克隆可以以比强化学习更具样本效率的方式加速最优策略的学习。然而,该策略无法很好地外推到演示数据之外的未见状态,造成协变量偏移(智能体偏离演示)与误差累积。在本工作中,我们通过扩展演示周围的吸引域来解决此问题,使智能体若偏离轨迹也能学习如何回到所演示的轨迹上。我们训练一个生成式反向动力学模型,并从演示中的状态生成短的预测轨迹。通过同时模仿演示与这些模型滚动,智能体学习了所演示的路径以及如何回到这些路径上。在最优或近最优演示下,所学策略将既最优又对偏差鲁棒,且具有更宽的吸引域。在连续控制域上,我们从演示数据中未见的不同的初始状态出发评估鲁棒性。虽然我们的方法与其他模仿学习基线都能成功解决训练分布中初始状态的任务,但我们的方法对不同初始状态表现出明显更强的鲁棒性。

关键词

引用

@article{arxiv.2210.09337,
  title  = {Robust Imitation of a Few Demonstrations with a Backwards Model},
  author = {Jung Yeon Park and Lawson L. S. Wong},
  journal= {arXiv preprint arXiv:2210.09337},
  year   = {2022}
}

备注

Conference on Neural Information Processing Systems (NeurIPS) 2022