中文

基于 Mamba 的人类运动控制 HuMam

机器人学 2026-02-12 v2 人工智能 新兴技术 系统与控制 信号处理 系统与控制

摘要

端到端强化学习 (RL) 用于人类 locomotion 具有紧凑感知-动作映射的吸引力,但实际策略常常 suffer from 训练不稳定、特征融合不高效以及高能耗。我们提出了 HuMam,一个以状态为中心的端到端 RL 框架,采用单层 Mamba 编码器融合机器人中心状态与定向脚步目标以及连续相位时钟。策略输出关节位置目标由低层 PD 环跟踪,并使用 PPO 进行优化。一个简洁的六项奖励平衡接触质量、摆动平滑性、脚步位置、姿态和身体稳定性,同时隐式促进节能。 在 JVRC-1 人类机器人上进行 mc-mujoco 测试,HuMam 在学习效率、训练稳定性和整体任务性能方面均优于强 feedforward 基线,同时降低了功耗和扭矩峰值。就目前采用 Mamba 作为融合骨干的端到端人类 RL 控制器而言,HuMam 在效率、稳定性和控制经济性方面实现了显著的提升。

关键词

引用

@article{arxiv.2509.18046,
  title  = {HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba},
  author = {Yinuo Wang and Yuanyang Qi and Jinzhao Zhou and Pengxiang Meng and Xiaowen Tao},
  journal= {arXiv preprint arXiv:2509.18046},
  year   = {2026}
}

备注

12 pages