中文

ViewPoint:用于生成全景视频的预训练扩散模型

计算机视觉与模式识别 2025-07-01 v1

摘要

全景视频生成旨在合成360度沉浸式视频,在VR、世界模型和空间智能等领域具有重要重要性。现有工作由于全景数据与透视数据之间的固有模态差距,导致难以生成高质量全景视频,而这两种数据在现代扩散模型的训练数据中占主导地位。本文提出了一种新框架,利用预训练的透视视频模型生成全景视频。具体而言,我们设计了一种名为ViewPoint图的新型全景表示方式,同时具备全局空间连续性和细粒度视觉细节。通过我们提出的Pano-Perspective注意力机制,模型能够从预训练的透视先验中受益,并有效地捕捉ViewPoint图的全景空间关联。大量实验表明,我们的方法能够合成高度动态且在空间上一致的全景视频,实现了最先进的性能,超越了之前的方法。

关键词

引用

@article{arxiv.2506.23513,
  title  = {ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models},
  author = {Zixun Fang and Kai Zhu and Zhiheng Liu and Yu Liu and Wei Zhai and Yang Cao and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2506.23513},
  year   = {2025}
}

备注

https://becauseimbatman0.github.io/ViewPoint