中文

SpotDiffusion:面向时序全景图像生成的高效方法

计算机视觉与模式识别 2025-01-08 v2

摘要

生成高分辨率图像的生成模型技术最近通过在大规模数据集上预训练的扩散模型实现了广泛可及。各种技术,如 MultiDiffusion 和 SyncDiffusion,进一步将图像生成的分辨率推进至训练分辨率之外,即从方形图像扩展到全景图像,通过合并多个重叠扩散路径或采用梯度下降来维持感知连贯性。然而,这些方法由于需要生成和平均大量预测,导致计算效率显著下降,这在实际中产生高质量且无缝的图像时尤为明显。本工作针对这一限制提出了新方法,消除需要生成和平均大量重叠去噪预测的需求。我们的方法在时间上移动非重叠的去噪窗口,确保一个时间步中的接缝在下一个时间步中得到纠正。这导致生成连贯的高分辨率图像所需的总步骤数显著减少。我们通过定性和定量评估展示了该方法的有效性,与 MultiDiffusion、SyncDiffusion 和 StitchDiffusion 进行了比较。我们的方法具有多个关键优势,包括 improved 计算效率和更快的推理时间,同时能够产生与之相当或更好的图像质量。代码链接 https://github.com/stanifrolov/spotdiffusion

关键词

引用

@article{arxiv.2407.15507,
  title  = {SpotDiffusion: A Fast Approach For Seamless Panorama Generation Over Time},
  author = {Stanislav Frolov and Brian B. Moser and Andreas Dengel},
  journal= {arXiv preprint arXiv:2407.15507},
  year   = {2025}
}

备注

Project page: https://spotdiffusion.github.io/