中文

MOHO:利用多视角遮挡感知监督学习单视角手持物体重建

计算机视觉与模式识别 2024-03-14 v2

摘要

以往关于单视角手持物体重建的工作通常依赖于来自 3D 真实模型的监督,而这类模型在真实世界中难以采集。相比之下,易获取的手-物视频提供了有前景的训练数据源,但它们仅给出严重遮挡的物体观测。本文提出一种新颖的从合成到真实的框架,利用手-物视频中的多视角遮挡感知监督来实现从单张图像的手持物体重建(MOHO),以应对该设定下两个主要挑战:手引起的遮挡与物体自身遮挡。首先,在合成预训练阶段,我们渲染了一个大规模合成数据集 SOMVideo,包含手-物图像和多视角无遮挡监督,用于在 2D 和 3D 空间中解决手引起的遮挡。其次,在真实世界微调阶段,MOHO 利用非模态掩码加权的几何监督来减轻真实世界中由手遮挡的监督视角所导致的不可靠引导。此外,MOHO 中融合了域一致的遮挡感知特征以抵抗物体自身遮挡,从而推断完整的物体形状。在 HO3D 和 DexYCB 数据集上的大量实验表明,2D 监督的 MOHO 大幅优于 3D 监督的方法。

关键词

引用

@article{arxiv.2310.11696,
  title  = {MOHO: Learning Single-view Hand-held Object Reconstruction with Multi-view Occlusion-Aware Supervision},
  author = {Chenyangguang Zhang and Guanlong Jiao and Yan Di and Gu Wang and Ziqin Huang and Ruida Zhang and Fabian Manhardt and Bowen Fu and Federico Tombari and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2310.11696},
  year   = {2024}
}

备注

CVPR 2024