中文

适度演员-评论方法:通过期望分位捕捉控制超估偏差

机器学习 2025-04-15 v1

摘要

超估是模型无关强化学习中固有的特征,源于时序差分学习原则和Q函数的近似。为解决此挑战,我们提出一种新的Q函数更新目标,即对已超估的Q函数及其下界进行凸优化。我们的主要贡献在于通过状态条件下Q值分布的下期望分位高效估计该下界。值得注意的是,我们的适度目标无缝集成到包括深度确定性策略梯度(DDPG)和软演员评论(SAC)等最先进的模型无关强化学习算法中。实验结果验证了我们适度目标在DDPG、SAC和分布式强化学习算法中缓解超估偏差的有效性。

关键词

引用

@article{arxiv.2504.09929,
  title  = {Moderate Actor-Critic Methods: Controlling Overestimation Bias via Expectile Loss},
  author = {Ukjo Hwang and Songnam Hong},
  journal= {arXiv preprint arXiv:2504.09929},
  year   = {2025}
}