适度演员-评论方法:通过期望分位捕捉控制超估偏差
机器学习
2025-04-15 v1
摘要
超估是模型无关强化学习中固有的特征,源于时序差分学习原则和Q函数的近似。为解决此挑战,我们提出一种新的Q函数更新目标,即对已超估的Q函数及其下界进行凸优化。我们的主要贡献在于通过状态条件下Q值分布的下期望分位高效估计该下界。值得注意的是,我们的适度目标无缝集成到包括深度确定性策略梯度(DDPG)和软演员评论(SAC)等最先进的模型无关强化学习算法中。实验结果验证了我们适度目标在DDPG、SAC和分布式强化学习算法中缓解超估偏差的有效性。
引用
@article{arxiv.2504.09929,
title = {Moderate Actor-Critic Methods: Controlling Overestimation Bias via Expectile Loss},
author = {Ukjo Hwang and Songnam Hong},
journal= {arXiv preprint arXiv:2504.09929},
year = {2025}
}