用于在线模仿学习的无奖励世界模型
机器学习
2025-05-13 v5
摘要
模仿学习使智能体能够直接从专家演示中获取技能,为强化学习提供了一种有吸引力的替代方案。然而,先前的在线模仿学习方法在处理以高维输入和复杂动力学为特征的复杂任务时存在困难。在这项工作中,我们提出了一种新颖的在线模仿学习方法,该方法利用了无奖励世界模型。我们的方法完全在潜在空间中学习环境动力学,无需重建,从而实现了高效且准确的建模。我们采用逆软Q学习目标,在Q-策略空间中重新表述优化过程,以缓解传统奖励-策略空间优化中固有的不稳定性。通过使用学习到的潜在动力学模型并进行规划控制,我们的方法在高维观测或动作空间以及复杂动力学的任务中,始终能实现稳定、专家级的性能。我们在多个基准测试上评估了我们的方法,包括DMControl、MyoSuite和ManiSkill2,证明了与现有方法相比优越的经验性能。
引用
@article{arxiv.2410.14081,
title = {Reward-free World Models for Online Imitation Learning},
author = {Shangzhe Li and Zhiao Huang and Hao Su},
journal= {arXiv preprint arXiv:2410.14081},
year = {2025}
}
备注
ICML 2025; Code available at: https://github.com/TobyLeelsz/iqmpc