DITTO:基于世界模型的离线模仿学习
机器学习
2025-03-24 v2 人工智能
摘要
为使模仿学习算法扩展到现实世界挑战,它们必须处理高维观测、离线学习以及策略引起的协变量偏移。我们提出 DITTO,一种解决上述三个问题的离线模仿学习算法。DITTO 在所学世界模型的潜空间中优化一种新颖的距离度量:首先,我们在所有可用轨迹数据上训练一个世界模型;随后,模仿智能体从该所学模型中的专家起始状态展开,并因其在多个时间步上与专家数据集的潜空间偏离而受到惩罚。我们使用标准强化学习算法优化这一多步潜空间偏离,该方法可证明地诱导出模仿学习,并在无需任何在线环境访问的情况下,在一系列基于像素的 Atari 环境中实证达到了最先进的性能与采样效率。我们还将其他标准模仿学习算法适配到世界模型设定中,并表明这显著提升了它们的性能。我们的结果表明,创造性地运用世界模型可带来一种简单、鲁棒且高性能的策略学习框架。
引用
@article{arxiv.2302.03086,
title = {DITTO: Offline Imitation Learning with World Models},
author = {Branton DeMoss and Paul Duckworth and Jakob Foerster and Nick Hawes and Ingmar Posner},
journal= {arXiv preprint arXiv:2302.03086},
year = {2025}
}