中文

价值来自观察:通过自我完善实现大规模模仿学习

机器学习 2025-07-10 v1

摘要

从观察中进行模仿学习(IfO)是一种强大的大规模学习行为的方法:与行为克隆或离线强化学习不同,IfO 可利用无动作示范,从而规避对昂贵带动作标注示范或奖励函数的需求。然而,当前的IfO研究聚焦于理想化场景,数据分布主要为双模态质量,限制了结果的实际意义。相反,本文探讨更细致的数据分布,提出一种方法从此类数据中学习,逐步接近可以通过自我完善实现模仿学习的范式。我们的方法将基于RL的模仿学习适应无动作示范,利用价值函数在专家和非专家数据之间传递信息。通过全面评估,我们描绘了不同数据分布与算法适用性之间的关系,并揭示了既定方法的局限性。我们的发现为开发更稳健、更实用的IfO技术提供了宝贵见解,为通往可扩展行为学习之路。

关键词

引用

@article{arxiv.2507.06701,
  title  = {Value from Observations: Towards Large-Scale Imitation Learning via Self-Improvement},
  author = {Michael Bloesch and Markus Wulfmeier and Philemon Brakel and Todor Davchev and Martina Zambelli and Jost Tobias Springenberg and Abbas Abdolmaleki and William F Whitney and Nicolas Heess and Roland Hafner and Martin Riedmiller},
  journal= {arXiv preprint arXiv:2507.06701},
  year   = {2025}
}