JoPano:通过联合建模实现统一全景生成
计算机视觉与模式识别
2025-12-09 v1 人工智能
摘要
全景生成近期引起了研究界的日益关注,包含两个核心任务:文本到全景生成和视图到全景生成。然而,现有方法仍面临两大挑战:其基于U-Net的架构限制了生成全景的视觉质量,且通常独立处理两个核心任务,导致建模冗余和效率低下。为克服这些挑战,我们提出了一种联合面全景(JoPano)生成方法,将两个核心任务统一在DiT模型中。为将现有DiT骨干网络从自然图像中学习到的丰富生成能力迁移到全景领域,我们提出了一种基于全景立方体贴图表示的联合面适配器,使预训练的DiT能够联合建模和生成全景的不同视角。我们进一步应用Poisson融合来减少立方体面边界处经常出现的接缝不一致性。对应地,我们引入了Seam-SSIM和Seam-Sobel指标来定量评估接缝一致性。此外,我们提出了一种条件切换机制,在单一模型中统一文本到全景和视图到全景任务。全面实验表明,JoPano能够为文本到全景和视图到全景生成任务生成高质量全景,在FID、CLIP-FID、IS和CLIP-Score指标上取得了最先进性能。
引用
@article{arxiv.2512.06885,
title = {JoPano: Unified Panorama Generation via Joint Modeling},
author = {Wancheng Feng and Chen An and Zhenliang He and Meina Kan and Shiguang Shan and Lukun Wang},
journal= {arXiv preprint arXiv:2512.06885},
year = {2025}
}
备注
Code: https://github.com/VIPL-GENUN/JoPano