MAHALO:统一离线强化学习与从观测模仿学习
机器学习
2023-08-08 v2
摘要
我们研究了一种用于序列决策的新范式,称为从观测的离线策略学习(PLfO)。离线PLfO旨在使用质量次优的数据集学习策略:1) 仅有一部分轨迹被标注了奖励,2) 标注轨迹可能不含动作,3) 标注轨迹质量可能不高,4) 数据可能未完全覆盖。此类不完美在真实学习场景中很常见,且离线PLfO涵盖了诸多现有离线学习设定,包括离线模仿学习(IL)、从观测的离线模仿学习(ILfO)和离线强化学习(RL)。本工作中,我们提出一种面向离线PLfO的通用方法,称为\textbf{M}odality-agnostic \textbf{A}dversarial \textbf{H}ypothesis \textbf{A}daptation for \textbf{L}earning from \textbf{O}bservations(MAHALO,模态无关对抗假设自适应从观测学习)。基于离线RL中的悲观主义概念,MAHALO利用考虑数据集覆盖不足所导致不确定性的性能下界来优化策略。我们通过对抗式训练数据一致的critic和奖励函数来实现该思想,从而迫使所学策略对数据缺失具有鲁棒性。我们表明,在理论与实验中,MAHALO在各类离线PLfO任务上持续优于或匹敌专用算法。我们的代码见 https://github.com/AnqiLi/mahalo。
引用
@article{arxiv.2303.17156,
title = {MAHALO: Unifying Offline Reinforcement Learning and Imitation Learning from Observations},
author = {Anqi Li and Byron Boots and Ching-An Cheng},
journal= {arXiv preprint arXiv:2303.17156},
year = {2023}
}