中文

VaLID:用于新视角合成的可变长度输入扩散模型

计算机视觉与模式识别 2023-12-15 v1

摘要

新视角合成(Novel View Synthesis, NVS)旨在给定源视角图像及其对应位姿的情况下,生成目标视角的真实感图像,是3D视觉中的一个基础问题。由于该任务是高度欠定的,一些近期工作(如Zero123)尝试利用生成式建模来解决这一问题,特别是使用预训练扩散模型。尽管该策略对新场景具有良好的泛化能力,但与基于神经辐射场的方法相比,其灵活性较低。例如,它只能接受单视角图像作为输入,而实际应用通常提供多张输入图像。这是因为源视角图像和对应的位姿被分开处理,并在不同阶段注入模型中。因此,一旦有多视角源图像可用,将模型扩展到多视角源图像并非易事。为解决这一问题,我们尝试分别处理每个位姿-图像对,然后将它们融合为一个统一的视觉表示,该表示将被注入模型以指导目标视角的图像合成。然而,随着输入源视角图像数量的增加,不一致性和计算成本也会增加。为解决这些问题,提出了Multi-view Cross Former模块,该模块将可变长度输入数据映射为固定大小的输出数据。引入了两阶段训练策略以进一步提高训练期间的效率。在多个数据集上的定性和定量评估证明了所提方法相对于以往方法的有效性。代码将在论文被接收后发布。

关键词

引用

@article{arxiv.2312.08892,
  title  = {VaLID: Variable-Length Input Diffusion for Novel View Synthesis},
  author = {Shijie Li and Farhad G. Zanjani and Haitam Ben Yahia and Yuki M. Asano and Juergen Gall and Amirhossein Habibian},
  journal= {arXiv preprint arXiv:2312.08892},
  year   = {2023}
}

备注

paper and supplementary material