中文

MEgoHand:面向多模态的轨迹式手-物体交互运动生成

计算机视觉与模式识别 2025-05-23 v1

摘要

轨迹式手-物体运动生成对于沉浸式 AR/VR 和机器人仿生具有重要重要性,但由于视点不稳定、自遮挡、视角畸变以及 ego-motion 噪声等问题仍具挑战性。现有方法依赖预定义的 3D 对象先验,限制了对新物体的泛化能力。与此同时,近期的多模态方法又因抽象文本线索导致生成歧义、建模 3D 手-物体关联关系的管道复杂以及开环预测中的误差叠加等问题。我们提出 MEgoHand,一个从轨迹式 RGB、文本和初始手势生成物理上合理手-物体交互的多模态框架。MEgoHand 引入双层架构:高层“脑叶”利用视觉语言模型 (VLM) 从视觉-文本语境中推断运动先验,并结合单目深度估计实现对象无关的空间推理;而低层则基于 DiT 的流匹配策略生成细粒度轨迹,并通过时序正交滤波提升稳定性。为解决数据集不一致问题,我们设计了逆 MANO 目标网络和虚拟 RGB-D 渲染器,构建了统一的数据集,包含 335 万 RGB-D 帧、2.4 万次交互和 1.2 千个物体。广泛的实验在五个领域内数据集和两个跨域数据集上表明,MEgoHand 在手腕平移误差降低 86.9%,关节旋转误差降低 34.1%,显示其在精细建模手部关节结构方面的能力以及在多样化场景下的鲁棒泛化能力。

关键词

引用

@article{arxiv.2505.16602,
  title  = {MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation},
  author = {Bohan Zhou and Yi Zhan and Zhongbin Zhang and Zongqing Lu},
  journal= {arXiv preprint arXiv:2505.16602},
  year   = {2025}
}