无OOD动作的离线RL:基于隐式价值正则化的样本内学习
机器学习
2023-03-29 v1 人工智能
摘要
大多数离线强化学习(RL)方法都受制于在改进策略以超越行为策略与约束策略以限制其偏离行为策略之间的权衡,因为使用分布外(OOD)动作计算 值会因分布偏移而产生误差。近期提出的样本内学习范式(即 IQL)仅使用数据样本通过分位数回归来改进策略,展现出巨大潜力,因为它无需查询任何未见动作的价值函数即可学习最优策略。然而,此类方法如何处理学习价值函数时的分布偏移仍不清楚。在本工作中,我们有一个关键发现:样本内学习范式是在隐式价值正则化(IVR)框架下产生的。这让我们更深入地理解样本内学习范式为何有效,即它对策略施加了隐式价值正则化。基于 IVR 框架,我们进一步提出两种实用算法:稀疏 学习(SQL)和指数 学习(EQL),它们采用了现有工作中相同的价值正则化,但以完全样本内的方式进行。与 IQL 相比,我们发现我们的算法在学习价值函数时引入了稀疏性,使其在含噪数据环境下更为鲁棒。我们还在 D4RL 基准数据集上验证了 SQL 和 EQL 的有效性,并通过在小数据环境下与 CQL 比较展示了样本内学习的优势。
引用
@article{arxiv.2303.15810,
title = {Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization},
author = {Haoran Xu and Li Jiang and Jianxiong Li and Zhuoran Yang and Zhaoran Wang and Victor Wai Kin Chan and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2303.15810},
year = {2023}
}
备注
ICLR 2023 notable top 5%