中文

DiffPoGAN:用于离线强化学习的扩散策略与生成对抗网络

机器学习 2024-06-14 v1

摘要

离线强化学习可从预收集之离线数据集中学习最优政策,无需与环境互动,但智能体所采样动作往往无法覆盖给定状态下之行动分布,致使出现外推误差问题。近期研究通过采用生成对抗网络 (GAN) 以解决此问题,但这些方法常 suffer from 对政策探索之不足约束与行为政策之 inaccurate 表示。此外,GAN 中生成器在蒙混判别器同时最大化政策预期收益方面效果不佳。鼓舞扩散模型之强大特征表达能力,我们提出一种新型离线 RL 方法,名为 基于生成对抗网络之扩散政策 (DiffPoGAN)。在此框架下,扩散 serving 为政策生成器以生成行动之多样分布,开发基于最大似然估计 (MLE) 之正则化方法以生成逼近行为政策分布之数据。此外,我们引入基于判别器输出之额外正则化项,以有效约束政策探索以实现政策改进。对 D4RL 数据集进行全面实验,实验结果表明 DiffPoGAN 在离线强化学习中超越了最新 SOTA 方法。

关键词

引用

@article{arxiv.2406.09089,
  title  = {DiffPoGAN: Diffusion Policies with Generative Adversarial Networks for Offline Reinforcement Learning},
  author = {Xuemin Hu and Shen Li and Yingfen Xu and Bo Tang and Long Chen},
  journal= {arXiv preprint arXiv:2406.09089},
  year   = {2024}
}