中文

超越画框:从透视视频生成 360 度全景视频

计算机视觉与模式识别 2026-04-24 v3

摘要

360 度视频已成为表征我们动态视觉世界的一种极具前景的媒介。与标准相机的“隧道视野”相比,其无边界的视野为我们的周围环境提供了更完整的视角。虽然现有的视频模型擅长生成标准视频,但它们生成完整全景视频的能力仍然难以实现。在本文中,我们研究了视频到 360 度生成的任务:给定一个透视视频作为输入,我们的目标是生成与原始视频一致的完整全景视频。与传统的视频生成任务不同,输出的视野显著更大,并且要求模型对场景的空间布局和物体的动态有深刻的理解,以保持时空一致性。为了应对这些挑战,我们首先利用网上丰富的 360 度视频,开发了一个高质量的数据过滤流水线,以整理成对的训练数据。然后,我们精心设计了一系列几何和运动感知操作,以促进学习过程并提高 360 度视频生成的质量。实验结果表明,我们的模型能够从自然透视视频中生成逼真且连贯的 360 度视频。此外,我们展示了其潜在应用,包括视频稳定、相机视角控制和交互式视觉问答。

关键词

引用

@article{arxiv.2504.07940,
  title  = {Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos},
  author = {Rundong Luo and Matthew Wallingford and Ali Farhadi and Noah Snavely and Wei-Chiu Ma},
  journal= {arXiv preprint arXiv:2504.07940},
  year   = {2026}
}

备注

Project page: https://red-fairy.github.io/argus/