Diffusion-DICE: 基于扩散模型的离线强化学习中的样本内扩散引导
机器学习
2024-11-01 v2 人工智能
摘要
DIstribution Correction Estimation(DICE)方法的一个重要特性是解答优化策略与数据收集策略之间的最优稳态分布比。本文我们表明,DICE方法可视为从行为分布到最优策略分布的转换。基于此,我们提出了一种新方法Diffusion-DICE,直接利用扩散模型执行此转换。我们发现,最优策略的得分函数可分解为两个项:行为策略的得分函数以及依赖于最优分布比的引导项梯度。前者可通过在数据集上训练的扩散模型获得,我们提出了一种样本内学习目标来学习后者。由于最优策略分布中包含多模态,Diffusion-DICE的转换可能指向局部最优模式。因此,我们生成少量候选动作并仔细选择以接近全局最优。与所有其他基于扩散的离线RL方法不同,Diffusion-DICE的引导-选择范式仅使用样本内动作进行训练,在价值函数中引入最小误差。我们使用一个教科书案例展示了以往基于扩散的方法因依赖这些误差而无法生成最优动作,而Diffusion-DICE成功地避免了这种情况。我们随后在基准数据集上进行大量实验,以显示Diffusion-DICE的卓越性能。项目页面为https://ryanxhr.github.io/Diffusion-DICE/。
引用
@article{arxiv.2407.20109,
title = {Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning},
author = {Liyuan Mao and Haoran Xu and Xianyuan Zhan and Weinan Zhang and Amy Zhang},
journal= {arXiv preprint arXiv:2407.20109},
year = {2024}
}
备注
NeurIPS 2024, first two authors contribute equally