中文

Anything-3D:面向野外单视图任意物体重建

计算机视觉与模式识别 2023-04-21 v1

摘要

在非受限真实场景中以单张 RGB 图像进行三维重建,由于物体与环境的固有多样性与复杂性而面临诸多挑战。本文中,我们提出 Anything-3D,一种将一系列视觉-语言模型与 Segment-Anything 物体分割模型巧妙结合的方法论框架,以将物体提升为三维,从而得到可靠且通用的单视图条件三维重建系统。我们的方法采用 BLIP 模型生成纹理描述,利用 Segment-Anything 模型有效提取感兴趣物体,并借助文本到图像扩散模型将物体提升为神经辐射场(neural radiance field)。\emph{Anything-3D\footnotemark[2]} 展示出对广泛物体生成准确细致三维重建的能力,显示出解决现有方法局限性的前景。通过在多个数据集上的综合实验与评估,我们展示了本方法的优势,强调其为三维重建领域作出实质贡献的潜力。演示与代码将发布于 \href{https://github.com/Anything-of-anything/Anything-3D}{https://github.com/Anything-of-anything/Anything-3D}。

关键词

引用

@article{arxiv.2304.10261,
  title  = {Anything-3D: Towards Single-view Anything Reconstruction in the Wild},
  author = {Qiuhong Shen and Xingyi Yang and Xinchao Wang},
  journal= {arXiv preprint arXiv:2304.10261},
  year   = {2023}
}