Consistent-1-to-3:基于几何感知扩散模型的一致图像到三维视图合成
计算机视觉与模式识别
2024-03-18 v2
摘要
从单幅图像进行零样本新视角合成(NVS)是三维物体理解中的一个基本问题。尽管近期利用预训练生成模型的方法能够从自然图像输入合成高质量新视角,它们仍难以在不同视角间保持三维一致性。本文中,我们提出 Consistent-1-to-3,这是一个显著缓解该问题的生成框架。具体而言,我们将 NVS 任务解耦为两个阶段:(i)将观测区域变换至新视角,以及(ii)想象未观测区域。我们分别设计了场景表示变换器与视角条件扩散模型来执行这两个阶段。在模型内部,为强化三维一致性,我们提出采用极线引导注意力以引入几何约束,以及多视角注意力以更好地聚合多视角信息。最后,我们设计了一种层次化生成范式来生成长序列的一致视角,从而实现对所给物体图像的完整 360 度观察。在多个数据集上的定性与定量评估证明了所提机制相对于最先进方法的有效性。我们的项目页面位于 https://jianglongye.com/consistent123/
引用
@article{arxiv.2310.03020,
title = {Consistent-1-to-3: Consistent Image to 3D View Synthesis via Geometry-aware Diffusion Models},
author = {Jianglong Ye and Peng Wang and Kejie Li and Yichun Shi and Heng Wang},
journal= {arXiv preprint arXiv:2310.03020},
year = {2024}
}
备注
Accepted to 3DV 2024. Project page: https://jianglongye.com/consistent123/