中文

DreamSparse:以 2D 冻结扩散模型从稀疏视角逃离柏拉图洞穴

计算机视觉与模式识别 2023-06-19 v4 人工智能 图形学

摘要

从少量视角合成新视角图像是一个具挑战性但实用的问题。现有方法在此少视角设定下常难以产生高质量结果,或需要对每物体进行优化,因为所提供信息不足。本工作中,我们探索利用预训练扩散模型中强大的 2D 先验来合成新视角图像。然而,2D 扩散模型缺乏 3D 感知,导致图像合成失真并损害身份一致性。为解决这些问题,我们提出 DreamSparse,一种使冻结的预训练扩散模型能够生成几何与身份一致的新视角图像的框架。具体而言,DreamSparse 整合了一个几何模块,旨在从稀疏视角捕获 3D 特征作为 3D 先验。随后,引入空间引导模型将这些 3D 特征图转换为生成过程的空间信息。该信息随后用于引导预训练扩散模型,使其无需微调即可生成几何一致的图像。借助预训练扩散模型中强大的图像先验,DreamSparse 能够为物体级和场景级图像合成高质量新视角,并泛化到开放集图像。实验结果表明,我们的框架能有效从稀疏视角合成新视角图像,并在训练类别和开放集类别图像上均优于基线。更多结果见项目页:https://sites.google.com/view/dreamsparse-webpage。

关键词

引用

@article{arxiv.2306.03414,
  title  = {DreamSparse: Escaping from Plato's Cave with 2D Frozen Diffusion Model Given Sparse Views},
  author = {Paul Yoo and Jiaxian Guo and Yutaka Matsuo and Shixiang Shane Gu},
  journal= {arXiv preprint arXiv:2306.03414},
  year   = {2023}
}