基于保守世界模型的高效模仿学习
机器学习
2024-08-19 v2
摘要
我们解决了在没有奖励函数的情况下从专家演示中进行策略学习的问题。该领域的一个核心挑战是,由于分布偏移、环境随机性或复合误差,这些策略在部署时会失败。对抗性模仿学习缓解了这个问题,但需要额外的在策略训练样本以保证稳定性,这在现实领域中由于学习效率低下和样本复杂度高而带来挑战。解决这个问题的一种方法是学习环境的世界模型,并使用合成数据进行策略训练。虽然在先前的工作中取得了成功,但我们认为这是次优的,因为学习模型和真实环境之间存在额外的分布偏移。相反,我们将模仿学习重新定义为微调问题,而不是纯强化学习问题。通过与离线强化学习和微调算法的理论联系,我们认为标准的在线世界模型算法不适合模仿学习问题。我们推导了一个有原则的保守优化界,并通过实验证明,它在两个来自高维原始像素观测的非常具有挑战性的操作环境中带来了改进的性能。我们在Franka Kitchen环境中从图像上设置了新的最先进性能,仅需10个演示且无奖励标签,并解决了一个复杂的灵巧操作任务。
引用
@article{arxiv.2405.13193,
title = {Efficient Imitation Learning with Conservative World Models},
author = {Victor Kolev and Rafael Rafailov and Kyle Hatch and Jiajun Wu and Chelsea Finn},
journal= {arXiv preprint arXiv:2405.13193},
year = {2024}
}
备注
Oral presentation, L4DC 2024