中文

基于一致可扩展标记的相机可控视频生成框架 CETCAM

计算机视觉与模式识别 2025-12-23 v1 机器学习

摘要

在视频生成中实现精确的相机控制 remains 挑战,因为现有方法常依赖难以扩展到大规模动态数据集且常与深度估计不一致的相机姿态标注,导致训练-测试间隙。我们引入 CETCAM,一个消除相机标注需求的相机可控视频生成框架,通过一致且可扩展的标记方案实现。CETCAM 利用 VGGT 等几何基础模型的最新进展来估计深度和相机参数,并将其转换为统一的、几何感知的标记。这些标记通过轻量级上下文模块无缝集成到预训练的视频扩散主干网络中。经过两个渐进阶段的训练,CETCAM 首先从多样化原始视频数据中学习鲁健的相机控制能力,然后利用筛选后的高保真数据集细化细粒度视觉质量。广泛实验表明,CETCAM 在几何一致性、时序稳定性和视觉真实性方面实现了最先进的水平。此外,CETCAM 对额外控制模态表现出强大的适应性,包括图像修复和布局控制,凸显其在相机控制之外的灵活性。项目页面可访问于 https://sjtuytc.github.io/CETCam_project_page.github.io/。

关键词

引用

@article{arxiv.2512.19020,
  title  = {CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization},
  author = {Zelin Zhao and Xinyu Gong and Bangya Liu and Ziyang Song and Jun Zhang and Suhui Wu and Yongxin Chen and Hao Zhang},
  journal= {arXiv preprint arXiv:2512.19020},
  year   = {2025}
}