中文

基于克拉姆距离的分布式强化学习

机器学习 2026-05-12 v1

摘要

本文探讨了将Soft Actor-Critic(SAC)算法应用于分布式强化学习设置,并引入一种名为克拉姆基于分布式Soft Actor-Critic(C-DSAC)的实现。该新方法采用分布式强化学习来表示状态-动作价值,并最小化平方克拉姆距离以学习分布。在各种机器人基准测试中,实验结果表明,我们的算法超越了基线SAC和当代分布式方法的性能,随着环境复杂度的增加,性能优势也日益显著。为了解释这种效率,我们进行了分析,显示其优越性能部分源于基于置信度的Q值更新:高方差目标分布(对目标置信度低)导致更保守的模型更新,从而减轻了被高估值的影响。本工作深化了对分布式强化学习的理解,提供了有关收敛和价值估计的算法机制见解。

关键词

引用

@article{arxiv.2605.08104,
  title  = {Distributional Reinforcement Learning via the Cram\'er Distance},
  author = {Vanya Aziz and Ivo Nowak and E. M. T Hendrix},
  journal= {arXiv preprint arXiv:2605.08104},
  year   = {2026}
}