奖励一致动力学模型对离线强化学习具有强泛化性
机器学习
2023-10-10 v1
摘要
学习精确的动力学模型对离线强化学习至关重要,但不幸的是这已被发现相当具有挑战性。通过拟合历史转移学到的动力学模型往往难以泛化至未见的转移。本研究中,我们识别出一种隐藏但关键的因素,称为动力学奖励,它在各转移间保持一致,为更好的泛化提供途径。因此,我们提出奖励一致动力学模型的思想:由动力学模型生成的任何轨迹都应最大化从数据导出的动力学奖励。我们将该思想实现为 MOREC(基于模型的具有奖励一致性的离线强化学习)方法,其可无缝集成进先前的离线基于模型的强化学习(MBRL)方法。MOREC 从离线数据学习可泛化的动力学奖励函数,随后用作任意离线 MBRL 方法中的转移过滤器:生成转移时,动力学模型生成一批转移并选取动力学奖励值最高者。在合成任务上,我们可视化表明 MOREC 具有强泛化能力,并能惊人地恢复某些遥远的未见转移。在 D4RL 与 NeoRL 基准的 21 个离线任务上,MOREC 以显著幅度提升先前最优性能,即在 D4RL 任务上 4.6%、在 NeoRL 任务上 25.9%。值得注意的是,MOREC 是首个能在 12 个 D4RL 任务中的 6 个和 9 个 NeoRL 任务中的 3 个上达到 95% 以上在线 RL 性能的方法。
引用
@article{arxiv.2310.05422,
title = {Reward-Consistent Dynamics Models are Strongly Generalizable for Offline Reinforcement Learning},
author = {Fan-Ming Luo and Tian Xu and Xingchen Cao and Yang Yu},
journal= {arXiv preprint arXiv:2310.05422},
year = {2023}
}