扩散策略作为离线强化学习的一类富于表达力的策略类
机器学习
2023-08-29 v3 机器学习
摘要
离线强化学习(RL)旨在利用先前收集的静态数据集学习最优策略,是 RL 的重要范式。标准 RL 方法常因对分布外动作的函数逼近误差而在此情形下表现不佳。尽管已提出多种正则化方法缓解该问题,它们常受限于表达能力有限的策略类,从而导致高度次优解。本文中,我们提出将策略表示为扩散模型——一类近期的高表达力深度生成模型。我们引入扩散 Q 学习(Diffusion-QL),其利用条件扩散模型表示策略。在我们的方法中,学习一个动作值函数,并将最大化动作值的项加入条件扩散模型的训练损失,从而得到寻求靠近行为策略的最优动作的损失。我们表明,基于扩散模型的策略的表达力,以及扩散模型下行为克隆与策略改进的耦合,共同促成了 Diffusion-QL 的优异性能。我们在具有多模态行为策略的简单 2D 赌博机示例中展示了方法的优越性,进而表明我们的方法能在大多数 D4RL 基准任务上取得最先进(SOTA)性能。
引用
@article{arxiv.2208.06193,
title = {Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning},
author = {Zhendong Wang and Jonathan J Hunt and Mingyuan Zhou},
journal= {arXiv preprint arXiv:2208.06193},
year = {2023}
}
备注
ICLR 2023