中文

MAHALO:统一离线强化学习与从观测模仿学习

机器学习 2023-08-08 v2

摘要

我们研究了一种用于序列决策的新范式,称为从观测的离线策略学习(PLfO)。离线PLfO旨在使用质量次优的数据集学习策略:1) 仅有一部分轨迹被标注了奖励,2) 标注轨迹可能不含动作,3) 标注轨迹质量可能不高,4) 数据可能未完全覆盖。此类不完美在真实学习场景中很常见,且离线PLfO涵盖了诸多现有离线学习设定,包括离线模仿学习(IL)、从观测的离线模仿学习(ILfO)和离线强化学习(RL)。本工作中,我们提出一种面向离线PLfO的通用方法,称为\textbf{M}odality-agnostic \textbf{A}dversarial \textbf{H}ypothesis \textbf{A}daptation for \textbf{L}earning from \textbf{O}bservations(MAHALO,模态无关对抗假设自适应从观测学习)。基于离线RL中的悲观主义概念,MAHALO利用考虑数据集覆盖不足所导致不确定性的性能下界来优化策略。我们通过对抗式训练数据一致的critic和奖励函数来实现该思想,从而迫使所学策略对数据缺失具有鲁棒性。我们表明,在理论与实验中,MAHALO在各类离线PLfO任务上持续优于或匹敌专用算法。我们的代码见 https://github.com/AnqiLi/mahalo。

关键词

引用

@article{arxiv.2303.17156,
  title  = {MAHALO: Unifying Offline Reinforcement Learning and Imitation Learning from Observations},
  author = {Anqi Li and Byron Boots and Ching-An Cheng},
  journal= {arXiv preprint arXiv:2303.17156},
  year   = {2023}
}