中文

一种利用离线数据集从观察中进行模仿学习的对偶方法

机器学习 2024-09-23 v2 人工智能 机器人学

摘要

在难以设计奖励函数的环境中,示范是学习智能体任务规范的有效替代方案。然而,当机器人具有复杂、非直观的形态时,在智能体的动作空间中演示专家行为变得笨拙。我们考虑一个实际场景:智能体拥有一个与环境先前交互的数据集,并且仅提供观察结果的专家示范。典型的从观察中学习方法需要学习逆动力学模型或判别器作为训练的中间步骤。这些中间单步模型中的误差会在后续的策略学习或部署中累积。我们通过直接学习一个多步效用函数来克服这些限制,该函数量化每个动作如何影响智能体与专家访问分布的偏离。利用对偶原理,我们推导出 DILO(从观察中进行对偶模仿学习),这是一种能够利用任意次优数据来学习模仿策略而无需专家动作的算法。DILO 将从观察中学习的问题简化为仅学习一个 actor 和一个 critic 的问题,其复杂度与普通离线强化学习相似。这使得 DILO 能够优雅地扩展到高维观察,并在各个方面展现出更优的性能。项目页面(代码和视频):\href\href{https://hari-sikchi.github.io/dilo/}{\text{hari-sikchi.github.io/dilo/}}

关键词

引用

@article{arxiv.2406.08805,
  title  = {A Dual Approach to Imitation Learning from Observations with Offline Datasets},
  author = {Harshit Sikchi and Caleb Chuck and Amy Zhang and Scott Niekum},
  journal= {arXiv preprint arXiv:2406.08805},
  year   = {2024}
}

备注

8th Conference on Robot Learning (CoRL 2024), Munich, Germany. 23 pages