中文

CT-1:视觉语言相机模型将空间推理知识传递到可控视频生成中

计算机视觉与模式识别 2026-04-13 v1

摘要

可控视频生成旨在合成具有灵活且物理上合理摄像机运动的视频。然而,现有方法要么提供来自文本提示的摄像机控制不够精确,要么依赖耗时的手动摄像机轨迹参数,限制了其在自动化场景中的应用。为此,我们提出了一种新型视觉语言相机模型,称为 CT-1(Camera Transformer 1),这是一种专为将空间推理知识传递到视频生成中而设计的模型,能够准确估计摄像机轨迹。基于视觉语言模块和扩散转换器模型,CT-1 在频域中采用小波正则化损失以有效学习复杂的摄像机轨迹分布。将这些轨迹集成到视频扩散模型中,以实现与用户意图相匹配的空间感知摄像机控制。为促进 CT-1 的训练,我们设计了专门的数据 curated 流程,构建了包含 4700 万帧的大型数据集 CT-200K。实验结果表明,我们的框架成功地在空间推理和视频合成之间搭建了桥梁,生成的可控摄像机视频质量可靠且高质量,摄像机控制精度比先前方法提高了 25.7%。

关键词

引用

@article{arxiv.2604.09201,
  title  = {CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation},
  author = {Haoyu Zhao and Zihao Zhang and Jiaxi Gu and Haoran Chen and Qingping Zheng and Pin Tang and Yeyin Jin and Yuang Zhang and Junqi Cheng and Zenghui Lu and Peng Shu and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2604.09201},
  year   = {2026}
}