对称 Q-learning:降低在线强化学习中 Bellman 误差的偏度
机器学习
2024-03-28 v1 人工智能
摘要
在深度强化学习中,估计值函数以评估状态和动作的质量至关重要。值函数通常使用最小二乘法训练,该方法隐式假设误差分布为高斯分布。然而,最近的一项研究表明,由于 Bellman 算子的性质,用于训练值函数的误差分布通常是偏斜的,这违反了最小二乘法中误差服从正态分布的隐式假设。为了解决这一问题,我们提出了一种名为 Symmetric Q-learning 的方法,该方法将从零均值分布生成的合成噪声添加到目标值中,以生成高斯误差分布。我们在 MuJoCo 的连续控制基准任务上评估了所提出的方法。该方法通过降低误差分布的偏度,提高了最先进的强化学习方法的样本效率。
引用
@article{arxiv.2403.07704,
title = {Symmetric Q-learning: Reducing Skewness of Bellman Error in Online Reinforcement Learning},
author = {Motoki Omura and Takayuki Osa and Yusuke Mukuta and Tatsuya Harada},
journal= {arXiv preprint arXiv:2403.07704},
year = {2024}
}
备注
Accepted at AAAI 2024: The 38th Annual AAAI Conference on Artificial Intelligence (Main Tech Track)