中文

SEABO:一种简单的基于搜索的离线模仿学习方法

机器学习 2024-02-22 v2 人工智能

摘要

离线强化学习(RL)因其能够从静态离线数据集中学习并消除与环境交互的需求而备受关注。然而,离线RL的成功在很大程度上依赖于带有奖励标签的离线转移。在实践中,我们通常需要手动设计奖励函数,这有时是困难、劳动密集或低效的。为了应对这一挑战,我们将重点放在离线模仿学习(IL)设置上,旨在基于专家数据和未标注数据获得奖励函数。为此,我们提出了一种简单而有效的基于搜索的离线IL方法,称为SEABO。SEABO以无监督学习的方式,为接近其最近邻专家演示的转移分配较大的奖励,否则分配较小的奖励。在多种D4RL数据集上的实验结果表明,仅需单个专家轨迹,SEABO即可达到与使用真实奖励的离线RL算法相竞争的性能,并且在许多任务上优于先前的奖励学习和离线IL方法。此外,我们证明如果专家演示仅包含观测,SEABO也能很好地工作。我们的代码公开在https://github.com/dmksjfl/SEABO。

关键词

引用

@article{arxiv.2402.03807,
  title  = {SEABO: A Simple Search-Based Method for Offline Imitation Learning},
  author = {Jiafei Lyu and Xiaoteng Ma and Le Wan and Runze Liu and Xiu Li and Zongqing Lu},
  journal= {arXiv preprint arXiv:2402.03807},
  year   = {2024}
}

备注

To appear in ICLR2024