中文

对齐意图:基于最优传输的离线模仿学习

机器学习 2024-10-07 v2 人工智能

摘要

离线强化学习(RL)通过学习预收集数据中的最优策略来解决序列决策问题,无需与环境交互。然而,该方法迄今为止仍缺乏实用性,因为人们很少能明确知晓奖励函数,且难以事后提炼奖励。在此,我们表明,即使没有显式奖励或动作标签,模仿智能体仅通过观察专家即可习得期望行为。在我们的方法 AILOT(基于最优传输的对齐模仿学习)中,我们引入了以“意图”形式表示的状态特殊表征,该表征融合了数据内的成对空间距离。基于此类表征,我们通过专家轨迹与智能体轨迹之间的最优传输距离定义了内在奖励函数。实验报告显示,AILOT 在 D4RL 基准测试中优于最先进的离线模仿学习算法,并通过在稀疏奖励任务中进行密集奖励重标注,提升了其他离线 RL 算法的性能。

关键词

引用

@article{arxiv.2402.13037,
  title  = {Align Your Intents: Offline Imitation Learning via Optimal Transport},
  author = {Maksim Bobrin and Nazar Buzun and Dmitrii Krylov and Dmitry V. Dylov},
  journal= {arXiv preprint arXiv:2402.13037},
  year   = {2024}
}