超越画框:从透视视频生成 360 度全景视频
计算机视觉与模式识别
2026-04-24 v3
摘要
360 度视频已成为表征我们动态视觉世界的一种极具前景的媒介。与标准相机的“隧道视野”相比,其无边界的视野为我们的周围环境提供了更完整的视角。虽然现有的视频模型擅长生成标准视频,但它们生成完整全景视频的能力仍然难以实现。在本文中,我们研究了视频到 360 度生成的任务:给定一个透视视频作为输入,我们的目标是生成与原始视频一致的完整全景视频。与传统的视频生成任务不同,输出的视野显著更大,并且要求模型对场景的空间布局和物体的动态有深刻的理解,以保持时空一致性。为了应对这些挑战,我们首先利用网上丰富的 360 度视频,开发了一个高质量的数据过滤流水线,以整理成对的训练数据。然后,我们精心设计了一系列几何和运动感知操作,以促进学习过程并提高 360 度视频生成的质量。实验结果表明,我们的模型能够从自然透视视频中生成逼真且连贯的 360 度视频。此外,我们展示了其潜在应用,包括视频稳定、相机视角控制和交互式视觉问答。
引用
@article{arxiv.2504.07940,
title = {Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos},
author = {Rundong Luo and Matthew Wallingford and Ali Farhadi and Noah Snavely and Wei-Chiu Ma},
journal= {arXiv preprint arXiv:2504.07940},
year = {2026}
}
备注
Project page: https://red-fairy.github.io/argus/