RoboMirror:视频到人形机器人运动控制中的“先理解后模仿”
机器人学
2026-01-06 v3 计算机视觉与模式识别
摘要
人类通过视觉观察学习运动,即先理解视觉内容,然后再模仿动作。然而,当前最先进的人形机器人运动控制系统依赖于精心挑选的动作捕捉轨迹或稀疏的文本指令,导致视觉理解与控制之间存在关键鸿沟。文本到运动方法存在语义稀疏和分阶段流水线误差的问题,而基于视频的方法仅进行机械的姿态模仿,缺乏真正的视觉理解。我们提出了 RoboMirror,这是首个体现“先理解后模仿”理念的无重定向视频到运动框架。该框架利用 VLM 将原始的第一人称/第三人称视频提炼为视觉运动意图,直接作为基于扩散策略的条件,生成物理上合理且语义对齐的运动,而无需显式的姿态重建或重定向。大量实验验证了 RoboMirror 的有效性:它通过第一人称视频实现了远程呈现,将第三人称控制延迟大幅降低了 80%,并取得了比基线高 3.7% 的任务成功率。通过围绕视频理解重新构建人形机器人控制,我们弥合了视觉理解与动作之间的鸿沟。
引用
@article{arxiv.2512.23649,
title = {RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion},
author = {Zhe Li and Cheng Chi and Boan Zhu and Yangyang Wei and Shuanghao Bai and Yuheng Ji and Yibo Peng and Tao Huang and Pengwei Wang and Zhongyuan Wang and S. -H. Gary Chan and Chang Xu and Shanghang Zhang},
journal= {arXiv preprint arXiv:2512.23649},
year = {2026}
}