中文

DiffPoint:基于 ViT 扩散模型的单视图与多视图点云重建

计算机视觉与模式识别 2024-02-20 v1 人工智能

摘要

随着 2D 到 3D 重建任务在各种现实场景中获得广泛关注,能够生成高质量点云变得至关重要。尽管深度学习模型在生成点云方面最近取得了成功,但由于图像和点云之间的差异,在产生高保真结果方面仍面临挑战。虽然视觉 Transformer (ViT) 和扩散模型在各种视觉任务中显示出前景,但它们在从图像重建点云方面的优势尚未得到证实。在本文中,我们首先提出了一种简洁而强大的架构 DiffPoint,它将 ViT 和扩散模型结合起来用于点云重建任务。在每个扩散步骤中,我们将噪声点云划分为不规则的补丁。然后,使用标准的 ViT 主干网络将所有输入视为 token(包括时间信息、图像嵌入和噪声补丁),我们训练模型基于输入图像预测目标点。我们在单视图和多视图重建任务上评估了 DiffPoint,并取得了最先进的结果。此外,我们引入了一种统一且灵活的特征融合模块,用于聚合来自单个或多个输入图像的特征。此外,我们的工作展示了应用统一架构跨越语言和图像以改进 3D 重建任务的可行性。

关键词

引用

@article{arxiv.2402.11241,
  title  = {DiffPoint: Single and Multi-view Point Cloud Reconstruction with ViT Based Diffusion Model},
  author = {Yu Feng and Xing Shi and Mengli Cheng and Yun Xiong},
  journal= {arXiv preprint arXiv:2402.11241},
  year   = {2024}
}