中文

EmbodMocap:具身智能体的野外4D人体-场景重建

计算机视觉与模式识别 2026-04-03 v2

摘要

现实世界中的人体行为自然编码丰富的、长期的上下文信息,可用于训练具身智能体进行感知、理解和行动。然而,现有捕获系统通常依赖昂贵的实验室 setup 和可穿戴设备,限制了在野外大规模收集场景条件下的人体动作数据。为此,我们提出EmbodMocap,一种便携且经济的数据收集管线,使用两部移动的iPhone。我们的核心思想是联合校准双目RGB-D序列,在统一的度量世界坐标系中重建人体与场景。该方法实现了无需静态摄像机或标记物的日常环境下的度量尺度和场景一致捕获,无缝地将人体动作与场景几何连接起来。与光学捕获的真实值比较,双目设置展现出显著的深度模糊化能力,实现人体与场景的优异对齐和重建性能。基于收集的数据,我们赋能了三个具身AI任务:单目人体-场景重建,通过微调前馈模型输出度量尺度、世界空间对齐的人体与场景;基于物理的人体动画,通过我们的数据扩展人体-物体交互技能和场景感知动作跟踪;以及机器人运动控制,通过仿真到现实的强化学习训练人形机器人复制视频中表现的人体动作。实验结果验证了我们管线的有效性及其对推动具身AI研究的贡献。

关键词

引用

@article{arxiv.2602.23205,
  title  = {EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents},
  author = {Wenjia Wang and Liang Pan and Huaijin Pi and Yuke Lou and Xuqian Ren and Yifan Wu and Zhouyingcheng Liao and Lei Yang and Rishabh Dabral and Christian Theobalt and Taku Komura},
  journal= {arXiv preprint arXiv:2602.23205},
  year   = {2026}
}