中文

ULTRA:面向人形机器人全身运动-操控的统一多模态控制

机器人学 2026-03-04 v1 计算机视觉与模式识别

摘要

实现人形机器人的自主且灵活的全身运动-操控仍是制约其实用性的核心瓶颈。然而现有方法存在根本性局限:重塑的数据常常稀缺或质量不足;方法难以扩展到大型技能储备;最重要的是,它们依赖跟踪预定义的运动参考,而非从感知和高层任务规格中生成行为。为此,我们提出 ULTRA,一个包含两个关键组件的统一框架。首先,我们引入一种基于物理的神经网络重目标算法,将大规模运动捕捉数据转换为人形机器人的姿态,同时保持接触丰富互动的物理可信性。其次,我们学习一个统一的多模态控制器,支持稠密参考和稀疏任务规格,感知范围从精准的运动捕捉状态到嘈杂的眼部视角输入。我们将一个通用跟踪策略蒸馏到该控制器中,将运动技能压缩到紧凑的潜在空间,并应用强化学习微调以扩大覆盖范围并提高对分布外情形的鲁棒性。这使得能够从稀疏意图出发,无需测试时的参考运动,实现协调的全身行为。我们在仿真环境和实际的 Unitree G1 人形机器人上进行评估。结果表明,ULTRA 能够从眼部视角感知实现自主的、以目标为导向的全身运动-操控,持续优于仅依赖跟踪的基线方法,后者技能有限。

关键词

引用

@article{arxiv.2603.03279,
  title  = {ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation},
  author = {Xialin He and Sirui Xu and Xinyao Li and Runpei Dong and Liuyu Bian and Yu-Xiong Wang and Liang-Yan Gui},
  journal= {arXiv preprint arXiv:2603.03279},
  year   = {2026}
}

备注

Project Page: https://ultra-humanoid.github.io/