中文

面向语言到运动控制的 Edge-Cloud 人oid 机器人协调框架 ECHO

计算机视觉与模式识别 2026-03-18 v1

摘要

我们提出 ECHO,一个面向语言驱动的人形机器人全身控制的 edge-cloud 框架。云端托管的基于扩散的文本到运动生成器从自然语言指令合成运动参考,而在边缘部署的强化学习跟踪器在机器人上闭环执行这些运动。两个模块通过一个紧凑、面向机器人的 38 维运动表示进行桥接,该表示为每个帧编码关节角度、根平面速度、根高度以及连续 6 维根姿态,从而消除推理时从人体模型中的 retargeting,并直接兼容低层 PD 控制。生成器采用基于 CLIP 编码文本特征的交叉注意力条件的 1D 卷积 UNet;在推理时,DDIM 采样以 10 步去噪和无分类器引导产生约 1 秒即可在云端 GPU 上生成运动序列。跟踪器遵循 Teacher-Student 范式:将特权教师策略蒸馏到轻量级学生端,学生端配备证据适应模块实现 sim-to-real 迁移,并通过形态对称约束和域随机化进一步强化。我们实现了一个自主跌倒恢复机制,通过 onboard IMU 读取检测跌倒并从预构建的运动库中检索恢复轨迹。在一个针对 HumanML3D 的 retarget化基准上评估 ECHO,在统一的机器人域评估器下实现了卓越的生成质量(FID 0.029,R-Precision Top-1 0.686),同时保持高运动安全性和轨迹一致性。真实世界实验在 Unitree G1 人形机器人上表明,无需硬件微调即可稳定执行多样化文本指令。

关键词

引用

@article{arxiv.2603.16188,
  title  = {ECHO: Edge-Cloud Humanoid Orchestration for Language-to-Motion Control},
  author = {Haozhe Jia and Jianfei Song and Yuan Zhang and Honglei Jin and Youcheng Fan and Wenshuo Chen and Wei Zhang and Yutao Yue},
  journal= {arXiv preprint arXiv:2603.16188},
  year   = {2026}
}