中文

FlashSAC:面向高维机器人控制的快速稳定异策略强化学习

机器学习 2026-05-18 v2 机器人学

摘要

强化学习(RL)是机器人控制的核心方法,尤其在专家演示不可用时。基于策略的方法如近端策略优化(PPO)因其稳定性而被广泛使用,但其对窄分布策略数据的依赖限制了在高维状态和动作空间中的准确策略评估。异策略方法可以通过从更广泛的状态-动作分布中学习来克服这一限制,但 suffers from 收敛缓慢和不稳定,因为在多样化数据上拟合价值函数需要大量梯度更新,导致评论家误差通过自举累积。我们提出了 FlashSAC,一个基于 Soft Actor-Critic 的快速稳定异策略RL算法。受监督学习中规模定律的启发,FlashSAC 大幅减少梯度更新次数,同时通过更大的模型和更高的数据吞吐率进行补偿。为在更大规模下维持稳定性,FlashSAC 显式约束权重、特征和梯度范数,抑制评论家误差累积。在10个模拟器中的60多个任务上,FlashSAC 在最终性能和训练效率方面始终优于 PPO 和强异策略基线,在灵巧操作等高维任务上增益最大。在 sim-to-real 人形 locomotion 中,FlashSAC 将训练时间从数小时缩短至数分钟,展示了异策略RL在 sim-to-real 迁移中的潜力。

关键词

引用

@article{arxiv.2604.04539,
  title  = {FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control},
  author = {Donghu Kim and Youngdo Lee and Minho Park and Kinam Kim and I Made Aswin Nahendra and Takuma Seno and Sehee Min and Daniel Palenicek and Florian Vogt and Danica Kragic and Jan Peters and Jaegul Choo and Hojoon Lee},
  journal= {arXiv preprint arXiv:2604.04539},
  year   = {2026}
}

备注

RSS'26