中文

基于遮蔽自回归模型的条件全景图像生成

计算机视觉与模式识别 2025-11-18 v2

摘要

近期全景图像生成的进展凸显了两种关键局限性:其一,大多数方法基于扩散模型,由于球面映射导致的独立同分布(i.i.d.)高斯噪声假设被迫破坏,因而不适用于等距投影(ERP)全景;其二,这些方法常将文本条件生成(文本到全景)和图像条件生成(全景扩图)视为独立任务,依赖不同架构和任务特定数据。本文提出一种统一框架——全景自回归模型(PAR),利用遮蔽自回归建模解决上述挑战。PAR规避了i.i.d.假设的约束,将文本和图像条件集成到单一架构中,实现跨任务的无缝生成。为解决现有生成模型中固有的连续性问题,我们引入循环填充以增强空间连贯性,并提出一致性对齐策略以提升生成质量。广泛的实验表明,PAR在文本到图像生成和全景扩图任务上实现了具竞争力的性能,同时展现了良好的可扩展性和泛化能力。

关键词

引用

@article{arxiv.2505.16862,
  title  = {Conditional Panoramic Image Generation via Masked Autoregressive Modeling},
  author = {Chaoyang Wang and Xiangtai Li and Lu Qi and Xiaofan Lin and Jinbin Bai and Qianyu Zhou and Yunhai Tong},
  journal= {arXiv preprint arXiv:2505.16862},
  year   = {2025}
}

备注

NeurIPS 2025