中文

从观察中学习:近期进展综述

机器学习 2025-09-25 v1 人工智能 机器人学 机器学习

摘要

模仿学习(IL)算法通过模仿专家行为来训练智能体,无需奖励函数,是一种高效的方法。IL 算法通常需要获取专家演示中的状态和动作信息。虽然专家动作能提供详细指导,但在专家动作难以获取的现实应用中,要求此类动作信息可能不切实际。为了解决这一局限,从观察中学习(LfO)或仅状态模仿学习(SOIL)的概念近期受到关注,其中模仿者只能访问专家的状态访问信息。在本文中,我们提出了一个 LfO 框架,并利用该框架从轨迹构建、假设和算法设计选择等方面对现有 LfO 方法进行了综述和分类。本综述还建立了与离线强化学习(RL)、基于模型的强化学习和分层强化学习等相关领域的联系。最后,我们利用该框架识别了开放性问题并提出了未来的研究方向。

关键词

引用

@article{arxiv.2509.19379,
  title  = {Learning from Observation: A Survey of Recent Advances},
  author = {Returaj Burnwal and Hriday Mehta and Nirav Pravinbhai Bhatt and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:2509.19379},
  year   = {2025}
}