FastDSAC:通过约束探索增强策略可塑性以实现可扩展的人形机器人运动
机器人学
2026-06-30 v1
摘要
可扩展强化学习普及了高吞吐量采样架构,这显著压缩了机器人运动中离策略方法的训练时间。然而,数据量和更新频率的快速增加削弱了基于价值方法的稳定性,并降低了策略网络的可塑性。为了应对这些挑战,本工作提出了 FastDSAC,这是为并行采样场景设计的分布式 Actor-Critic 算法的快速高性能变体。具体而言,我们引入了截断高斯分布来近似学习到的策略,这有效地排除了使目标价值估计紧张的分布外动作,同时保留了探索所需的随机性。所提出的动作约束作为隐式正则化,抵消了通常由激进梯度更新引起的可塑性损失。这种网络适应性的保留提高了样本效率,特别是在更新数据比高的场景中,并加速了早期训练过程。与依赖离散价值分布的先前快速强化学习方法相比,我们的方法利用配备自适应方差调节的连续高斯表示,通过采样自信且信息丰富的转换来提高价值估计准确性。在 MuJoCo Playground 和 HumanoidBench 上的大量实验表明,与最先进的基线相比,FastDSAC 不仅稳定了整体训练过程,还实现了卓越的渐近性能和更快的收敛速度。
引用
@article{arxiv.2606.31691,
title = {FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion},
author = {Guanchen Lu and Yajuan Dun and Yi Zhou and Letian Tao and Jingliang Duan and Jie Li and Guofa Li},
journal= {arXiv preprint arXiv:2606.31691},
year = {2026}
}
备注
8 pages, 9 figures. Code is available at https://github.com/luge66/FastDSAC