中文

SPRINQL:次优演示驱动的离线模仿学习

机器学习 2024-10-14 v3 人工智能

摘要

我们专注于离线模仿学习 (IL),其旨在利用演示来模仿专家行为,而无需与环境进行任何交互。离线 IL 的主要挑战之一是专家演示的支持有限,通常仅覆盖状态 - 动作空间的一小部分。虽然获取大量专家演示可能不可行,但往往可以收集到更大规模的次优演示集。例如,在治疗优化问题中,针对不同慢性疾病存在不同水平的医生治疗方案,从治疗专家、经验丰富的全科医生到经验较少的全科医生不等。同样,当训练机器人模仿人类执行常规任务时,它们可能会从具有不同专业水平和效率的个体那里学习。在本文中,我们提出了一种离线 IL 方法,该方法利用更大规模的次优演示集,同时有效模仿专家轨迹。现有的基于行为克隆或分布匹配的离线 IL 方法往往面临一些问题,例如对有限的专家演示集过拟合,或无意中模仿了大数据集中的次优轨迹。我们的方法基于逆软 Q 学习 (inverse soft-Q learning),能够从专家演示和次优演示中同时学习。它通过学到的权重分配更高的重要性以对齐专家演示,并分配较低的重要性以对齐次优演示。我们称为 SPRINQL 的方法的一个关键贡献是将离线 IL 问题转化为 Q 函数空间上的凸优化问题。通过全面的实验评估,我们证明了 SPRINQL 算法在离线 IL 基准测试中实现了最先进 (SOTA) 的性能。代码地址:https://github.com/hmhuy0/SPRINQL。

关键词

引用

@article{arxiv.2402.13147,
  title  = {SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning},
  author = {Huy Hoang and Tien Mai and Pradeep Varakantham},
  journal= {arXiv preprint arXiv:2402.13147},
  year   = {2024}
}

备注

accepted at NeurIPS 2024