中文

DiffPano: 基于球面极线感知扩散的可扩展且一致的文字到全景图生成

计算机视觉与模式识别 2024-11-01 v1 人工智能 图形学 机器人学

摘要

基于扩散的方法在 2D 图像或 3D 对象生成方面取得了显著成就,但 3D 场景甚至 360° 图像的生成仍受到限制,原因包括场景数据集数量有限、3D 场景本身的复杂性以及生成一致的多视角图像的困难。为了解决这些问题,我们首先建立了一个大规模全景视频-文本数据集,其中包含数百万个连续的全景关键帧,以及对应的全景深度、相机姿态和文本描述。然后,我们提出了一种新型的文字驱动全景生成框架 DiffPano,以实现可扩展、一致且多样的全景场景生成。具体来说,得益于稳定扩散的强大生成能力,我们使用 LoRA 在建立的全景视频-文本数据集上对单视角文字到全景扩散模型进行了微调。我们进一步设计了一个球面极线感知的多视角扩散模型,以确保生成的全景图像的多视角一致性。大量实验证明,DiffPano 可以根据给定的未见文本描述和相机姿态生成可扩展、一致且多样的全景图像。

关键词

引用

@article{arxiv.2410.24203,
  title  = {DiffPano: Scalable and Consistent Text to Panorama Generation with Spherical Epipolar-Aware Diffusion},
  author = {Weicai Ye and Chenhao Ji and Zheng Chen and Junyao Gao and Xiaoshui Huang and Song-Hai Zhang and Wanli Ouyang and Tong He and Cairong Zhao and Guofeng Zhang},
  journal= {arXiv preprint arXiv:2410.24203},
  year   = {2024}
}

备注

NeurIPS2024, Project: https://github.com/zju3dv/DiffPano; Code: https://github.com/zju3dv/DiffPano