CubeDiff:将基于扩散的图像模型用于全景图生成
计算机视觉与模式识别
2025-01-29 v1 机器学习
摘要
我们提出一种 novel 方法,用于从文本提示或图像生成360°全景图。我们的方法利用最新3D生成技术的进展,采用多视图扩散模型联合合成六个面板的立方体地图。不同于以前依赖处理等距投影或自回归生成的方法,本方法将每个面板视为标准的透视图像,从而简化了生成过程,使能够使用现有的多视图扩散模型。我们演示了这些模型可以adapt以生产高质量的立方体地图,而无需对应感知注意力层。该模型允许进行细粒度的文本控制,生成高分辨率全景图像,并在其训练集之外获得良好泛化,同时实现了定量和定性的state-of-the-art结果。项目页面:https://cubediff.github.io/
引用
@article{arxiv.2501.17162,
title = {CubeDiff: Repurposing Diffusion-Based Image Models for Panorama Generation},
author = {Nikolai Kalischek and Michael Oechsle and Fabian Manhardt and Philipp Henzler and Konrad Schindler and Federico Tombari},
journal= {arXiv preprint arXiv:2501.17162},
year = {2025}
}
备注
Accepted at ICLR 2025