中文

VividCam:从虚拟合成视频中学习非常规摄像运动

计算机视觉与模式识别 2025-10-30 v1

摘要

虽然最近的文本到视频生成模型在跟随外部摄像控制方面越来越强大,无论是通过文本描述还是摄像轨迹来实现,但它们仍然难以泛化到非常规摄像运动,这在创建真正原创和艺术性视频中至关重要。挑战在于寻找足够具有预期不寻常摄像运动的训练视频。为了解决这一挑战,我们提出了 VividCam,这是一种训练范式,使扩散模型能够从合成视频中学习复杂的摄像运动,摆脱对收集真实训练视频的依赖。VividCam 包含多种解耦策略,将摄像运动学习从合成外观瑕疵中隔离,确保更稳健的运动表示并减轻领域偏移。我们展示了该设计如何使用惊人地简单的合成数据合成广泛范围的精确控制和复杂摄像运动。值得注意的是,这些合成数据通常由低多边形 3D 场景中的基本几何构成,可通过诸如 Unity 之类的引擎高效渲染。我们的视频结果可在 https://wuqiuche.github.io/VividCamDemoPage/ 查看。

关键词

引用

@article{arxiv.2510.24904,
  title  = {VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos},
  author = {Qiucheng Wu and Handong Zhao and Zhixin Shu and Jing Shi and Yang Zhang and Shiyu Chang},
  journal= {arXiv preprint arXiv:2510.24904},
  year   = {2025}
}

备注

19 pages, 9 figures