UDQL:弥合离线强化学习中MSE损失与最优价值函数之间的差距
机器学习
2024-06-06 v1
摘要
均方误差(MSE)被广泛用于估计绝大多数离线强化学习(RL)模型中最优价值函数的解,并取得了出色的性能。然而,我们发现其原理可能导致价值函数的高估现象。在本文中,我们首先从理论上分析了由MSE导致的高估现象,并提供了高估误差的理论上界。此外,为了解决这个问题,我们提出了一种新颖的贝尔曼低估算子来抵消高估现象,然后证明了其收缩特性。最后,我们提出了基于低估算子和扩散策略模型的离线RL算法。在D4RL任务上的大量实验结果表明,我们的方法可以超越最先进的离线RL算法,这证明了我们的理论分析和低估方法对于离线RL任务是有效的。
引用
@article{arxiv.2406.03324,
title = {UDQL: Bridging The Gap between MSE Loss and The Optimal Value Function in Offline Reinforcement Learning},
author = {Yu Zhang and Rui Yu and Zhipeng Yao and Wenyuan Zhang and Jun Wang and Liming Zhang},
journal= {arXiv preprint arXiv:2406.03324},
year = {2024}
}