中文

如何在离线模仿学习中利用多样化示范

机器学习 2024-05-31 v3 人工智能

摘要

由于许多现实领域中专家数据的稀缺,使用不完美示范的离线模仿学习(IL)受到了越来越多的关注。在这种场景下,一个基本问题是如何从噪声数据中提取正向行为。通常,当前解决该问题的方法基于与给定专家示范的状态-动作相似性来选择数据,忽略了偏离专家示范的(可能大量的)多样化\textit{多样化} 状态-动作中的宝贵信息。在本文中,我们引入了一种简单而有效的数据选择方法,该方法根据结果状态来识别正向行为——这是一种更具信息量的标准,能够显式利用动力学信息并有效提取专家行为和有益的多样化行为。此外,我们设计了一种轻量级的行为克隆算法,能够正确利用专家数据和所选数据。在实验中,我们在一系列复杂且高维的离线 IL 基准上评估了我们的方法,包括连续控制和基于视觉的任务。结果表明,我们的方法实现了 SOTA 性能,在 20/21\textbf{20/21} 个基准上优于现有方法,通常具有 2-5x\textbf{2-5x} 的优势,同时保持了与行为克隆(BC\texttt{BC})相当的运行时间。

关键词

引用

@article{arxiv.2405.17476,
  title  = {How to Leverage Diverse Demonstrations in Offline Imitation Learning},
  author = {Sheng Yue and Jiani Liu and Xingyuan Hua and Ju Ren and Sen Lin and Junshan Zhang and Yaoxue Zhang},
  journal= {arXiv preprint arXiv:2405.17476},
  year   = {2024}
}

备注

International Conference on Machine Learning (ICML)