HIPODE:通过策略解耦方法以高质量合成数据增强离线强化学习
机器学习
2023-06-13 v1
摘要
离线强化学习(ORL)作为一种利用预收集静态数据训练强化学习模型的方法已受到关注。为解决数据有限的问题并提升下游ORL性能,近期工作尝试通过数据增强扩展数据集的覆盖率。然而,此类方法大多与特定策略绑定(策略相关),所生成数据仅能保证支持当前下游ORL策略,限制了其在其他下游策略上的使用范围。此外,合成数据质量常未受良好控制,限制了进一步提升下游策略的潜力。为应对这些问题,我们提出HIgh-quality POlicy-DEcoupled(HIPODE),一种新颖的ORL数据增强方法。一方面,HIPODE利用负采样技术,从候选状态中选取靠近数据集分布且潜在价值高的状态,从而生成高质量合成数据。另一方面,HIPODE为策略解耦,因此可作为通用插件方法用于任意下游ORL过程。我们在广泛研究的TD3BC与CQL算法上开展实验,结果表明在D4RL基准上HIPODE优于最先进的策略解耦数据增强方法及大多数主流基于模型的ORL方法。
引用
@article{arxiv.2306.06329,
title = {HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach},
author = {Shixi Lian and Yi Ma and Jinyi Liu and Yan Zheng and Zhaopeng Meng},
journal= {arXiv preprint arXiv:2306.06329},
year = {2023}
}