中文

从图像和视频中三维重建手持物体

计算机视觉与模式识别 2026-01-01 v4

摘要

手部操控的物体(即操控物)从互联网视频中重建尤其具有挑战性。手不仅遮挡了物体的大部分,而且物体通常仅出现在少量图像像素中。同时,在此场景中出现了两个强有力的锚点:(1)估计的三维手部有助于消除物体的位置和尺度的歧义;(2)操控物的集合相对于所有可能的物体而言较小。基于这些见解,我们提出了一种可扩展的手持物体重建范式,该范式建立在大型语言/视觉模型和三维物体数据集的最新突破之上。给定单目RGB视频,我们的目标是随时间重建手持物体的三维几何形状。为了获得最佳性能的单帧模型,我们首先提出MCC-Hand-Object(MCC-HO),该模型以单张RGB图像和推断的三维手部作为输入,联合重建手部和物体的几何形状。随后,我们使用GPT-4(V)提示文本到三维生成模型,以检索与图像中物体匹配的三维物体模型;我们将这种对齐称为检索增强重建(RAR)。RAR在所有帧上提供统一的物体几何形状,并且结果在时间上一致地与输入图像和三维MCC-HO观测值刚性对齐。实验表明,我们的方法在实验室和互联网图像/视频数据集上达到了最先进的性能。我们在项目网站上提供代码和模型:https://janehwu.github.io/mcc-ho。

关键词

引用

@article{arxiv.2404.06507,
  title  = {Reconstructing Hand-Held Objects in 3D from Images and Videos},
  author = {Jane Wu and Georgios Pavlakos and Georgia Gkioxari and Jitendra Malik},
  journal= {arXiv preprint arXiv:2404.06507},
  year   = {2026}
}

备注

3DV 2026, Project page: https://janehwu.github.io/mcc-ho