中文

ZeroWBC:从人类三脚镜视频中直接学习自然的人类全身控制

机器人学 2026-03-11 v1 人工智能

摘要

实现人类机器人场景交互的通用且自然的全身控制仍是一个重大挑战。虽然一些最近的工作已展示了自主的人类全身交互控制,但受限于刚性运动模式和昂贵的遥操作数据收集,缺乏执行诸如坐下或踢球等更人类化自然行为的灵活性。此外,获取必要的真实机器人遥操作数据在成本和时间方面都不可行。为此,我们引入了 ZeroWBC,一个 novel 框架,直接从人类三脚镜视频中学习自然的人类全身控制策略,消除对大规模机器人遥操作数据需求,实现人类全身机器人场景交互控制。具体而言,我们的方法首先微调了视觉语言模型(VLM),基于文本指令和三脚镜视觉上下文预测未来的全身人类运动,然后将这些生成的运动 retarget 到真实机器人关节上,通过我们稳健的通用运动跟随策略执行。广泛的在 Unitree G1 人类全身机器人上的实验表明,我们的方法在运动自然性和灵活性方面优于基线方法,成功建立了一个消除全身人类控制遥操作数据收集开销的管道,为通用的人类全身控制提供了可扩展且高效的范式。

关键词

引用

@article{arxiv.2603.09170,
  title  = {ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video},
  author = {Haoran Yang and Jiacheng Bao and Yucheng Xin and Haoming Song and Yuyang Tian and Bin Zhao and Dong Wang and Xuelong Li},
  journal= {arXiv preprint arXiv:2603.09170},
  year   = {2026}
}