ConsistNet:为多视角图像扩散强制 3D 一致性
计算机视觉与模式识别
2023-10-17 v1
摘要
给定一张 3D 物体的单张图像,本文提出一种新方法(名为 ConsistNet),能够生成同一物体的多张图像,仿佛从不同的视点捕捉,同时有效利用这些生成图像之间的 3D(多视角)一致性。我们方法的核心是一个多视角一致性模块,它基于底层多视角几何原理实现多个单视角扩散过程之间的信息交换。ConsistNet 是标准隐扩散模型(LDM)的扩展,由两个子模块组成:(a) 视图聚合模块,将多视角特征反投影到全局 3D 体并推断一致性;(b) 光线聚合模块,采样并聚合 3D 一致特征回每个视图以强制一致性。我们的方法不同于以往的多视角图像生成方法,因为它可以轻松插入预训练的 LDM 中,无需显式的像素对应或深度预测。实验表明,我们的方法在冻结的 Zero123 骨干上有效学习了 3D 一致性,并能在单张 A100 GPU 上 40 秒内生成物体的 16 个环绕视图。我们的代码将在 https://github.com/JiayuYANG/ConsistNet 上提供。
引用
@article{arxiv.2310.10343,
title = {ConsistNet: Enforcing 3D Consistency for Multi-view Images Diffusion},
author = {Jiayu Yang and Ziang Cheng and Yunfei Duan and Pan Ji and Hongdong Li},
journal= {arXiv preprint arXiv:2310.10343},
year = {2023}
}