中文

DiT360:基于混合训练的高保真全景图像生成

计算机视觉与模式识别 2025-10-14 v1

摘要

本文提出了 DiT360,一个基于 DiT 的框架,通过对视角数据和全景数据进行混合训练,以实现全景图像生成。为解决在生成质量中维持几何保真度和照片 realism 的问题,我们将主要原因归因于缺乏大规模、高质量的真实世界全景数据,这种数据中心的观点不同于先前关注模型设计的方法。基本上,DiT360 包含几个用于跨域转换和域内增强的关键模块,分别应用于预 VAE 图像级别和后 VAE token 级别。在图像级别,我们通过视角图像引导和全景细化融合跨域知识,这增强了感知质量,同时正则化多样性和照片 realism。在 token 级别,应用跨多个模块的混合监督,包括用于边界连续性的循环填充、用于旋转鲁棒性的 yaw 损失,以及用于失真感知的 cube 损失。在针对文本到全景、填充和外填充任务进行的大量实验表明,我们的方法在十一项定性指标上实现了更好的边界一致性和图像保真度。我们的代码已提供:https://github.com/Insta360-Research-Team/DiT360。

关键词

引用

@article{arxiv.2510.11712,
  title  = {DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training},
  author = {Haoran Feng and Dizhe Zhang and Xiangtai Li and Bo Du and Lu Qi},
  journal= {arXiv preprint arXiv:2510.11712},
  year   = {2025}
}

备注

https://fenghora.github.io/DiT360-Page/