DCE:基于双重保守估计的离线强化学习
机器学习
2022-09-28 v1
摘要
离线强化学习在解决传统强化学习的应用挑战方面引起了广泛关注。离线强化学习使用先前收集的数据集训练智能体,而无需任何交互。为解决对OOD(分布外)动作的高估问题,保守估计对所有输入给出较低的值。以往的保守估计方法通常难以避免OOD动作对Q值估计的影响。此外,这些算法通常需要损失一定的计算效率以实现保守估计的目的。本文提出一种简单的保守估计方法——双重保守估计(DCE),其使用两种保守估计方法约束策略。我们的算法引入V函数以避免分布内动作的错误,同时隐式实现保守估计。此外,我们的算法使用可控惩罚项改变训练中的保守程度。我们从理论上展示了该方法如何影响OOD动作与分布内动作的估计。我们的实验分别表明两种保守估计方法影响所有状态-动作的估计。DCE在D4RL上展示了最先进的性能。
引用
@article{arxiv.2209.13132,
title = {DCE: Offline Reinforcement Learning With Double Conservative Estimates},
author = {Chen Zhao and Kai Xing Huang and Chun yuan},
journal= {arXiv preprint arXiv:2209.13132},
year = {2022}
}