中文

InteractVLM:从二维基础模型推断三维人体-物体接触

计算机视觉与模式识别 2025-04-08 v1

摘要

我们提出 InteractVLM,一种新方法,用于从单张野外图像估计人体与物体的三维接触点,从而实现对人体-物体的准确三维重建。这一任务面临遮挡、深度歧义以及物体形状差异巨大的挑战。现有方法依赖通过高昂动作捕捉系统或繁琐人工标注收集的三维接触标注数据,限制了其规模和泛化能力。为克服此困难,InteractVLM 利用大型视觉语言模型(Vision-Language Models, VLMs)的广泛视觉知识,并通过有限的三维接触数据进行微调。然而,直接应用这些模型并不直接可行,因为它们仅在二维空间推理,而人体-物体接触本质上是三维的。因此,我们引入了新颖的 Render-Localize-Lift 模块:(1) 通过多视图渲染将三维人体和物体表面嵌入二维空间;(2) 训练新型多视图局部化模型(MV-Loc)以推断二维中的接触点;(3) 将其提升至三维。此外,我们提出了一种新任务,即语义人体接触估计(Semantic Human Contact estimation),其中人体接触预测显式地以物体语义为条件,从而实现更丰富的交互建模。InteractVLM 在接触估计任务上超越了现有方法,并能够从野外图像实现三维重建。代码和模型已提供于 https://interactvlm.is.tue.mpg.de。

关键词

引用

@article{arxiv.2504.05303,
  title  = {InteractVLM: 3D Interaction Reasoning from 2D Foundational Models},
  author = {Sai Kumar Dwivedi and Dimitrije Antić and Shashank Tripathi and Omid Taheri and Cordelia Schmid and Michael J. Black and Dimitrios Tzionas},
  journal= {arXiv preprint arXiv:2504.05303},
  year   = {2025}
}

备注

CVPR 2025