中文

带三项改进的分布软演员-评论家算法

机器学习 2025-08-07 v7 系统与控制 系统与控制

摘要

强化学习(RL)在解决复杂决策与控制任务中已展现出显著成功。然而,许多无模型 RL 算法因价值估计不准而出现性能退化,尤其是 Q 值的高估会导致次优策略。为解决此问题,我们此前提出了分布软演员-评论家(DSAC 或 DSACv1),一种离策略 RL 算法,通过学习连续高斯价值分布来提升价值估计精度。尽管有效,DSACv1 面临训练不稳定和对奖励尺度敏感等挑战,其源于回报随机性导致的评论家梯度高方差。本文中,我们引入三项对 DSACv1 的关键改进以克服这些局限并进一步提升 Q 值估计精度:期望值替代、双价值分布学习,以及基于方差的评论家梯度调整。增强后的算法称为带三项改进的分布软演员-评论家(DSAC-T 或 DSACv2),在多种基准任务上进行了系统评估。无需任务特定超参数调优,DSAC-T 在所有测试环境中一致地匹配或超越领先的无模型 RL 算法,包括 SAC、TD3、DDPG、TRPO 和 PPO。此外,DSAC-T 确保了稳定的学习过程,并在不同奖励尺度下保持鲁棒性能。其有效性进一步通过控制轮式机器人的实际应用得到展示,凸显了其在实用机器人任务中部署的潜力。

关键词

引用

@article{arxiv.2310.05858,
  title  = {Distributional Soft Actor-Critic with Three Refinements},
  author = {Jingliang Duan and Wenxuan Wang and Liming Xiao and Jiaxin Gao and Shengbo Eben Li and Chang Liu and Ya-Qin Zhang and Bo Cheng and Keqiang Li},
  journal= {arXiv preprint arXiv:2310.05858},
  year   = {2025}
}

备注

Title updated in this version. The previous version was titled "DSAC-T: Distributional Soft Actor-Critic With Three Refinements". Added a footnote with the BibTeX entry for the published journal version. No other major changes