面向离线模仿学习的最优传输
机器学习
2023-03-27 v1
摘要
随着大型数据集的出现,离线强化学习(RL)是一种无需与真实环境交互即可学习良好决策策略的有前景的框架。然而,离线 RL 要求数据集带有奖励标注,当奖励工程困难或获取奖励标注劳动密集时,这带来了实际挑战。在本文中,我们引入最优传输奖励标注(OTR),一种利用少量高质量示范为离线轨迹分配奖励的算法。OTR 的核心思想是使用最优传输计算数据集中未标注轨迹与专家示范之间的最优对齐,以获得可解释为奖励的相似度度量,随后可被离线 RL 算法用于学习策略。OTR 易于实现且计算高效。在 D4RL 基准上,我们表明带有单个示范的 OTR 能持续匹配具有真实奖励的离线 RL 的性能。
引用
@article{arxiv.2303.13971,
title = {Optimal Transport for Offline Imitation Learning},
author = {Yicheng Luo and Zhengyao Jiang and Samuel Cohen and Edward Grefenstette and Marc Peter Deisenroth},
journal= {arXiv preprint arXiv:2303.13971},
year = {2023}
}
备注
Published in ICLR 2023