中文

ES-C51:基于期望Sarsa的C51分布强化学习算法

机器学习 2025-10-20 v1

摘要

在大多数基于价值的强化学习(RL)算法中,智能体仅估计每个动作的期望奖励,并选择奖励最高的动作。相比之下,分布强化学习(DRL)估计可能奖励的整个概率分布,提供关于不确定性和变异性的更丰富信息。C51是一种用于离散动作空间的流行DRL算法。它采用Q学习方法,通过贪婪的贝尔曼更新来学习分布。然而,如果状态下的多个动作具有相似的期望奖励但分布不同,这可能会引发问题,因为算法可能无法学习到稳定的分布。本研究提出了C51的改进版本(ES-C51),用期望Sarsa更新替换贪婪的Q学习更新,该更新使用softmax计算来组合状态下所有可能动作的信息,而不是依赖单个最佳动作。这减少了动作具有相似期望奖励时的不稳定性,并使智能体能够学习性能更高的策略。该方法在Gym的经典控制环境和Atari-10游戏上进行了评估。为公平比较,我们将标准C51的探索策略从ε-贪婪改为softmax,称之为QL-C51(基于Q学习的C51)。结果表明,ES-C51在多个环境中优于QL-C51。

关键词

引用

@article{arxiv.2510.15006,
  title  = {ES-C51: Expected Sarsa Based C51 Distributional Reinforcement Learning Algorithm},
  author = {Rijul Tandon and Peter Vamplew and Cameron Foale},
  journal= {arXiv preprint arXiv:2510.15006},
  year   = {2025}
}