基于高保真生成式行为建模的离线强化学习
机器学习
2023-03-01 v2
摘要
在离线强化学习中,加权回归是一种常用方法,用于确保所学策略接近行为策略并防止选择样本外动作。本工作中,我们表明由于策略模型有限的分布表达能力,以往方法在训练时仍可能选择未见过的动作,这偏离了其最初动机。为解决该问题,我们采用一种生成式方法,将所学策略解耦为两部分:一个富有表达力的生成式行为模型和一个动作评估模型。关键洞见在于,此种解耦避免了学习具有闭式表达的显式参数化策略模型。直接学习行为策略使我们能借助生成建模的现有进展(如基于扩散的方法)来建模多样行为。至于动作评估,我们将方法与样本内规划技术结合,以进一步避免选择样本外动作并提升计算效率。在 D4RL 数据集上的实验结果表明,相较于最先进的离线 RL 方法,我们所提方法取得了有竞争力或更优的性能,尤其在 AntMaze 等复杂任务中。我们还通过经验证明,该方法能成功从包含多种独特但同样成功的策略的异质数据集中学习,而以往的单峰策略则失败。
引用
@article{arxiv.2209.14548,
title = {Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling},
author = {Huayu Chen and Cheng Lu and Chengyang Ying and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:2209.14548},
year = {2023}
}