中文

MVDiffusion:基于对应感知扩散实现整体多视图图像生成

计算机视觉与模式识别 2023-12-27 v7

摘要

本文提出 MVDiffusion,一种简单而有效的方法,用于从给定像素到像素对应(例如全景图的透视裁剪,或给定深度图与位姿的多视图图像)的文本提示生成一致的多视图图像。不同于依赖迭代图像变形与修复的先前方法,MVDiffusion 同时生成所有图像并具有全局感知,有效解决了普遍存在的误差累积问题。其核心在于, MVDiffusion 利用预训练的文本到图像扩散模型并行处理透视图像,同时集成新颖的对应感知注意力层以促进跨视图交互。对于全景生成,尽管仅用 10k 全景图训练,MVDiffusion 能为任意文本生成高分辨率逼真图像,或将一张透视图像外推至 360 度视图。对于多视图深度到图像生成,MVDiffusion 在场景网格纹理化上展示了最先进的性能。

关键词

引用

@article{arxiv.2307.01097,
  title  = {MVDiffusion: Enabling Holistic Multi-view Image Generation with Correspondence-Aware Diffusion},
  author = {Shitao Tang and Fuyang Zhang and Jiacheng Chen and Peng Wang and Yasutaka Furukawa},
  journal= {arXiv preprint arXiv:2307.01097},
  year   = {2023}
}

备注

Project page, https://mvdiffusion.github.io; NeurIPS 2023 (spotlight); Compressed camera-ready version