中文

一种基于Dyna风格方法的四足动物 locomotion 学习方法

机器人学 2025-09-09 v1 人工智能

摘要

传统的基于强化学习的 locomotion 控制器常常存在数据效率低下的问题,需要大量交互才能实现稳健性能。我们提出了一种基于模型的强化学习(MBRL)框架,通过在基于PPO控制器的标准 rollout 末尾追加合成数据,提高了四足动物 locomotion 的样本效率,遵循Dyna风格范式。一个与策略同时训练的预测模型生成短期合成转移,并通过基于策略更新迭代次数的调度策略逐渐集成。通过消融研究,我们识别到了样本效率与 rollout 长度之间的强相关性,这指导了我们实验的设计。我们在Unitree Go1机器人上通过仿真验证了该方法,结果表明,用合成步骤替代部分仿真步骤不仅能模拟延长的 rollout,还能提高策略回报并降低方差。最后,我们展示了这一改进能够通过更少的仿真步骤实现对广泛 locomotion 命令的跟踪能力。

关键词

引用

@article{arxiv.2509.06296,
  title  = {Learning to Walk with Less: a Dyna-Style Approach to Quadrupedal Locomotion},
  author = {Francisco Affonso and Felipe Andrade G. Tommaselli and Juliano Negri and Vivian S. Medeiros and Mateus V. Gasparino and Girish Chowdhary and Marcelo Becker},
  journal= {arXiv preprint arXiv:2509.06296},
  year   = {2025}
}

备注

Under review at IEEE Robotics and Automation Letters. 8 pages