价值来自观察:通过自我完善实现大规模模仿学习
机器学习
2025-07-10 v1
摘要
从观察中进行模仿学习(IfO)是一种强大的大规模学习行为的方法:与行为克隆或离线强化学习不同,IfO 可利用无动作示范,从而规避对昂贵带动作标注示范或奖励函数的需求。然而,当前的IfO研究聚焦于理想化场景,数据分布主要为双模态质量,限制了结果的实际意义。相反,本文探讨更细致的数据分布,提出一种方法从此类数据中学习,逐步接近可以通过自我完善实现模仿学习的范式。我们的方法将基于RL的模仿学习适应无动作示范,利用价值函数在专家和非专家数据之间传递信息。通过全面评估,我们描绘了不同数据分布与算法适用性之间的关系,并揭示了既定方法的局限性。我们的发现为开发更稳健、更实用的IfO技术提供了宝贵见解,为通往可扩展行为学习之路。
引用
@article{arxiv.2507.06701,
title = {Value from Observations: Towards Large-Scale Imitation Learning via Self-Improvement},
author = {Michael Bloesch and Markus Wulfmeier and Philemon Brakel and Todor Davchev and Martina Zambelli and Jost Tobias Springenberg and Abbas Abdolmaleki and William F Whitney and Nicolas Heess and Roland Hafner and Martin Riedmiller},
journal= {arXiv preprint arXiv:2507.06701},
year = {2025}
}