基于伪度量学习的离线强化学习
机器学习
2021-06-03 v2
摘要
离线强化学习方法旨在从环境的已记录转移中学习策略,而无需任何交互。在存在函数近似且环境状态-动作空间覆盖有限的假设下,有必要约束策略访问接近已记录转移支撑集的状态-动作对。本工作中,我们提出一种迭代过程,从已记录转移中学习伪度量(与互模拟度量密切相关),并用其定义此种接近性概念。我们证明了其收敛性并将其推广至函数近似设定。随后,我们利用该伪度量在 actor-critic 算法中定义一种新的基于查找的奖励:PLOFF。该奖励鼓励 actor 在所指伪度量意义上靠近已记录转移的支撑集。最后,我们在手部操作与运动任务上评估了该方法。
引用
@article{arxiv.2103.01948,
title = {Offline Reinforcement Learning with Pseudometric Learning},
author = {Robert Dadashi and Shideh Rezaeifar and Nino Vieillard and Léonard Hussenot and Olivier Pietquin and Matthieu Geist},
journal= {arXiv preprint arXiv:2103.01948},
year = {2021}
}
备注
ICML 2021