中文

MS-PPO:基于形态学-对称性等变策略的腿式机器人 locomotion

机器人学 2025-12-02 v1

摘要

强化学习最近使腿式机器人在 locomotion 方面取得了惊人的成就;然而,大多数策略架构仍不具备形态学和对称性,不利于训练效率和泛化能力。本工作引入MS-PPO(Morphological-Symmetry-Equivariant Policy),一种编码机器人运动学结构和形态学对称性的策略学习框架。我们构建了一个具备形态学感知性质的图神经网络架构,证明其对机器人形态学对称性群作用是等变的,确保在对称状态下策略作出一致响应,同时在价值估计中保持不变性。该设计无需繁琐的奖励塑形或高成本的数据增强。我们在Unitree Go2和Xiaomi CyberDog2机器人上进行仿真评估,涵盖踝跑、原地跑、斜坡行走和双足转向等多样化 locomotion 任务,并在硬件上部署了所学策略。大量实验表明,MS-PPO在训练稳定性、对称泛化能力和挑战性 locomotion 任务中的样本效率方面均优于最先进的基线。这些发现表明,将运动学结构和形态学对称性嵌入策略学习为腿式机器人 locomotion 控制提供了强大的归纳偏置。我们的代码将在https://lunarlab-gatech.github.io/MS-PPO/公开。

关键词

引用

@article{arxiv.2512.00727,
  title  = {MS-PPO: Morphological-Symmetry-Equivariant Policy for Legged Robot Locomotion},
  author = {Sizhe Wei and Xulin Chen and Fengze Xie and Garrett Ethan Katz and Zhenyu Gan and Lu Gan},
  journal= {arXiv preprint arXiv:2512.00727},
  year   = {2025}
}