PanoWan:利用经纬度感知机制将扩散视频生成模型提升至 360 度
计算机视觉与模式识别
2025-06-26 v2
摘要
全景视频生成支持沉浸式 360 度内容创作,在需要场景一致的世界探索应用中极具价值。然而,由于数据集规模有限且空间特征表示存在差异,现有的全景视频生成模型难以利用来自传统文本到视频模型的预训练生成先验来生成高质量和多样化的全景视频。在本文中,我们引入 PanoWan,通过最少的模块有效地将预训练的文本到视频模型提升至全景领域。PanoWan 采用纬度感知采样以避免纬度畸变,同时其旋转语义去噪与填充像素级解码确保了经度边界处的无缝过渡。为了为学习这些提升后的表示提供足够的全景视频,我们贡献了 PanoVid,这是一个带有字幕且场景多样的高质量全景视频数据集。因此,PanoWan 在全景视频生成中实现了 SOTA 性能,并在零样本下游任务中展现出鲁棒性。我们的项目页面可在 https://panowan.variantconst.com 获取。
引用
@article{arxiv.2505.22016,
title = {PanoWan: Lifting Diffusion Video Generation Models to 360{\deg} with Latitude/Longitude-aware Mechanisms},
author = {Yifei Xia and Shuchen Weng and Siqi Yang and Jingqi Liu and Chengxuan Zhu and Minggui Teng and Zijian Jia and Han Jiang and Boxin Shi},
journal= {arXiv preprint arXiv:2505.22016},
year = {2025}
}