中文

通过解耦反向传播的一阶模型基RL

机器人学 2025-09-05 v2 人工智能 机器学习

摘要

越来越多的强化学习(RL)方法试图利用仿真器的导数以提高学习效率。虽然早期基于梯度的方法在性能上优于无导数的方法,但获取仿真器梯度往往代价高昂或不可得。基于模型的RL(MBRL)可通过学习的动态模型近似这些梯度,但求解器效率会因训练滚动预测误差的叠加效应而受到影响,从而影响策略性能。我们提出一种将轨迹生成与梯度计算解耦的方法:轨迹使用仿真器展开,而梯度通过对仿真器的可微模型进行反向传播计算。这种混合设计即使在仿真器梯度不可得时,也能实现高效且一致的一阶策略优化,同时还能从仿真器滚动中学习评估函数,这种评估更为准确。我们的方法在样本效率和速度上达到专用优化器如SHAC的水平,同时保持了标准方法如PPO的通用性,避免了其他一阶MBRL方法中观察到的异常行为。我们在基准控制任务上经验性地验证了该算法,并在真实的Go2四足机器人上证明了其有效性,涵盖四足和二足 locomotion 任务。

关键词

引用

@article{arxiv.2509.00215,
  title  = {First Order Model-Based RL through Decoupled Backpropagation},
  author = {Joseph Amigo and Rooholla Khorrambakht and Elliot Chane-Sane and Nicolas Mansard and Ludovic Righetti},
  journal= {arXiv preprint arXiv:2509.00215},
  year   = {2025}
}

备注

CoRL 2025. Project website: https://machines-in-motion.github.io/DMO/