中文

EgoMotion:面向自我中心视觉-语言运动生成的层次化推理与扩散

计算机视觉与模式识别 2026-04-22 v1

摘要

在动态环境中忠实建模人类行为是具身智能的基础性挑战。尽管条件运动合成已取得显著进展,但由于第一人称感知的固有复杂性,自我中心运动生成在很大程度上仍未被充分探索。在本研究中,我们探讨了自我中心视觉-语言(Ego-VL)运动生成。该任务要求在第一人称视觉观测和自然语言指令的共同条件下合成 3D 人体运动。我们识别出一个关键的“推理-生成纠缠”挑战:语义推理与运动学建模的同步优化会引发梯度冲突。这些冲突会系统性地降低多模态对齐的保真度与运动质量。为应对这一挑战,我们提出了一个层次化生成框架 EgoMotion。受认知推理与运动控制的生物学解耦启发,EgoMotion 分两个阶段运行。在认知推理阶段,视觉-语言模型(VLM)将多模态输入投影到离散运动基元的结构化空间中。这迫使 VLM 获取与目标一致的表示,有效弥合高层感知理解与低层动作执行之间的语义鸿沟。在运动生成阶段,这些学习到的表示作为基于扩散的运动生成器的表达性条件信号。通过在连续潜在空间中执行迭代去噪,该生成器合成了物理上合理且时间上连贯的轨迹。广泛评估表明,EgoMotion 达到了 SOTA 性能,且生成的运动序列在语义对齐与运动学表现上均优于现有方法。

关键词

引用

@article{arxiv.2604.19105,
  title  = {EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation},
  author = {Ruibing Hou and Mingyue Zhou and Yuwei Gui and Mingshuang Luo and Bingpeng Ma and Hong Chang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2604.19105},
  year   = {2026}
}

备注

12 pages, 3 figures