中文

CamC2V:基于上下文感知的可控视频生成

计算机视觉与模式识别 2026-05-29 v3

摘要

最近的图像到视频(I2V)扩散模型在场景理解和生成质量方面展现了惊人的能力,通过图像条件来指导生成。然而,这些模型主要在其提供的上下文范围内进行动画,不得不超越其限制。引入额外约束(如相机轨迹)可增强多样性,但常常会降低视觉质量,限制其在需要忠实场景表示的任务中的适用性。我们提出了 CamC2V,一种上下文到视频(C2V)模型,将多个图像条件作为上下文与 3D 约束以及相机控制相结合,以丰富全局语义和细粒度视觉细节。这使得更连贯且上下文感知的视频生成成为可能。此外,我们动机说明了对有效上下文表示的时序感知的必要性。我们对 RealEstate10K 数据集进行全面研究,显示我们的方法在视觉质量和相机可控性方面实现了 24.09%(FVD)的改进。我们的代码已公开:https://github.com/LDenninger/CamC2V。

关键词

引用

@article{arxiv.2504.06022,
  title  = {CamC2V: Context-aware Controllable Video Generation},
  author = {Luis Denninger and Sina Mokhtarzadeh Azar and Juergen Gall},
  journal= {arXiv preprint arXiv:2504.06022},
  year   = {2026}
}

备注

Published at 3DV 2026