面向离线强化学习的自适应优势引导策略正则化
机器学习
2024-07-16 v3 人工智能
机器人学
摘要
在离线强化学习中,分布外(out-of-distribution, OOD)问题尤为突出。为解决此问题,现有方法通常通过策略正则化来约束所学习的策略。然而,这些方法常因不加区分地将行为策略生成的离线数据集中所有动作作为约束而导致不必要的保守,从而阻碍策略改进。当数据集质量不佳时,这一问题尤为突出。因此,我们提出自适应优势引导策略正则化(Adaptive Advantage-guided Policy Regularization, A2PR),通过结合 VAE 获取高优势动作,以指导所学习的策略。A2PR 能够从数据集中不同于现有动作的高优势动作中进行选择,同时有效维持 OOD 动作的保守性。这一成果通过利用 VAE 的能力生成与数据点分布匹配的样本来实现。我们在理论上证明了行为策略的改进是得到保证的。此外,该方法有效缓解了价值过度估计,并在性能差距受限。实验方面,我们在 D4RL 基准上进行一系列实验,其中 A2PR 实现了最佳性能。此外,实验结果表明,在额外的次优混合数据集上,A2PR 也表现出优异的性能。代码已在 https://github.com/ltlhuuu/A2PR 上提供。
引用
@article{arxiv.2405.19909,
title = {Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning},
author = {Tenglong Liu and Yang Li and Yixing Lan and Hao Gao and Wei Pan and Xin Xu},
journal= {arXiv preprint arXiv:2405.19909},
year = {2024}
}
备注
ICML 2024, 19 pages