PanoLora:用于桥接全景与透视图视频生成的 LoRA 适配
计算机视觉与模式识别
2025-09-16 v1 人工智能
摘要
生成高质量的 360{\deg} 全景视频仍是一个重大挑战,因为全景与传统透视图投影之间存在根本差异。虽然透视图视频依赖单一视点且视野有限,但全景内容需要渲染完整的周围环境,这使得标准视频生成模型难以适应。现有解决方案常引入复杂的体系结构或大规模训练,导致效率低下且结果次优。灵感来源于 Low-Rank Adaptation(LoRA)在风格迁移任务中的成功,我们提出将全景视频生成视为从透视图适配的问题。通过理论分析,我们展示 LoRA 在其秩超过任务自由度时,能够有效地建模这些投影之间的转换。我们的做法仅使用约 1000 个视频就能高效微调预训练视频扩散模型,实现高质量的全景生成。实验结果表明,我们的方法在保持恰当投影几何的同时,在视觉质量、左右一致性和运动多样性方面均优于以往的最新方法。
引用
@article{arxiv.2509.11092,
title = {PanoLora: Bridging Perspective and Panoramic Video Generation with LoRA Adaptation},
author = {Zeyu Dong and Yuyang Yin and Yuqi Li and Eric Li and Hao-Xiang Guo and Yikai Wang},
journal= {arXiv preprint arXiv:2509.11092},
year = {2025}
}