基于对称等价强化学习的协调人类机器人 locomotion
机器人学
2025-11-18 v2
摘要
人类神经系统具有双侧对称性,使其能够实现协调且平衡的运动。然而,现有深度强化学习(DRL)方法针对人类机器人忽略了机器人的形态对称性,导致运动不协调且次优。灵感来源于人类运动控制,我们提出对称等价策略(SE-Policy),一种新的DRL框架,在actor中嵌入严格的对称等价性,在critic中实现对称不变性,无需额外超参数。SE-Policy强制对称观测下的行为一致,产生具有更高任务性能的时空协调运动。在仿真和Unitree G1人形机器人上的大规模实验表明,SE-Policy在速度跟踪任务中相较于国际前沿方法提升最高40%,同时实现优越的空间-时间协调。这些结果证明了SE-Policy的有效性及其在人形机器人中的广泛适用性。
引用
@article{arxiv.2508.01247,
title = {Coordinated Humanoid Robot Locomotion with Symmetry Equivariant Reinforcement Learning Policy},
author = {Buqing Nie and Yang Zhang and Rongjun Jin and Zhanxiang Cao and Huangxuan Lin and Xiaokang Yang and Yue Gao},
journal= {arXiv preprint arXiv:2508.01247},
year = {2025}
}
备注
AAAI 2026 accepted