基于数据集约束的策略正则化用于离线强化学习
机器学习
2023-08-16 v2 人工智能
摘要
我们考虑从固定数据集中学习最优策略的问题,即离线强化学习(RL)。现有离线RL工作的一种常见分类为策略正则化,其通常通过行为策略的分布或支撑来约束所学策略。然而,分布与支撑约束过于保守,因为它们在考虑特定状态时均强制策略选择类似于行为策略的动作。这会限制所学策略的性能,尤其在行为策略次优时。本文中,我们发现将策略正则化至最近的状态-动作对更为有效,从而提出基于数据集约束的策略正则化(PRDC)。当在给定状态下更新策略时,PRDC在整个数据集中搜索最近的状态-动作样本,并以该样本的动作约束策略。与以往工作不同,PRDC可利用数据集中恰当的行为引导策略,使其能选择数据集中未随给定状态出现的动作。这是一种更柔和的约束,但仍对分布外动作保持足够保守性。经验证据与理论分析表明,PRDC能以有界性能差距缓解离线RL根本性的价值高估难题。此外,在一组运动与导航任务上,PRDC相较现有方法取得了最先进的性能。代码见https://github.com/LAMDA-RL/PRDC
引用
@article{arxiv.2306.06569,
title = {Policy Regularization with Dataset Constraint for Offline Reinforcement Learning},
author = {Yuhang Ran and Yi-Chen Li and Fuxiang Zhang and Zongzhang Zhang and Yang Yu},
journal= {arXiv preprint arXiv:2306.06569},
year = {2023}
}
备注
Accepted to ICML 2023