O$^2$-Recon:利用预训练2D扩散模型完成场景中遮挡物体的3D重建
计算机视觉与模式识别
2024-03-20 v3
摘要
遮挡是从RGB-D视频进行3D重建中的常见问题,常阻碍物体的完整重建,且至今仍是待解难题。本文中,我们提出一个由基于2D扩散的修复模型赋能的新颖框架,为物体被遮挡部分重建完整表面。具体而言,我们利用预训练扩散模型填补2D图像中的隐藏区域,随后用这些修复后的图像优化每个实例的神经隐式表面表示以进行3D重建。由于生成该过程所需的修复掩码颇为棘手,我们采用一种仅涉及极少人工参与的人机协同策略来生成高质量掩码。此外,由于视频通常从有限视角拍摄,物体某些部分可能完全隐藏。为恢复这些不可见区域,我们开发了用于预测符号距离场的级联网络架构,利用位置编码的不同频带并保持整体平滑性。除常用的渲染损失、Eikonal损失与轮廓损失外,我们采用基于CLIP的语义一致性损失来引导来自未见相机视角的表面。在ScanNet场景上的实验表明,我们提出的框架在从场景级RGB-D视频进行物体级重建中达到了最先进的精度与完整度。代码:https://github.com/THU-LYJ-Lab/O2-Recon。
引用
@article{arxiv.2308.09591,
title = {O$^2$-Recon: Completing 3D Reconstruction of Occluded Objects in the Scene with a Pre-trained 2D Diffusion Model},
author = {Yubin Hu and Sheng Ye and Wang Zhao and Matthieu Lin and Yuze He and Yu-Hui Wen and Ying He and Yong-Jin Liu},
journal= {arXiv preprint arXiv:2308.09591},
year = {2024}
}
备注
AAAI 2024