基于克拉姆距离的分布式强化学习
机器学习
2026-05-12 v1
摘要
本文探讨了将Soft Actor-Critic(SAC)算法应用于分布式强化学习设置,并引入一种名为克拉姆基于分布式Soft Actor-Critic(C-DSAC)的实现。该新方法采用分布式强化学习来表示状态-动作价值,并最小化平方克拉姆距离以学习分布。在各种机器人基准测试中,实验结果表明,我们的算法超越了基线SAC和当代分布式方法的性能,随着环境复杂度的增加,性能优势也日益显著。为了解释这种效率,我们进行了分析,显示其优越性能部分源于基于置信度的Q值更新:高方差目标分布(对目标置信度低)导致更保守的模型更新,从而减轻了被高估值的影响。本工作深化了对分布式强化学习的理解,提供了有关收敛和价值估计的算法机制见解。
引用
@article{arxiv.2605.08104,
title = {Distributional Reinforcement Learning via the Cram\'er Distance},
author = {Vanya Aziz and Ivo Nowak and E. M. T Hendrix},
journal= {arXiv preprint arXiv:2605.08104},
year = {2026}
}