中文

基于变分推断的可控视频合成方法 Ctrl-VI

计算机视觉与模式识别 2025-10-17 v2 人工智能

摘要

许多视频工作流程都受益于用户控制粒度不同的混合,从精确的 4D 物体轨迹和相机路径到粗糙的文本提示,而现有的视频生成模型通常针对固定的输入格式进行训练。我们开发了 Ctrl-VI,一种视频合成方法,旨�满足这一需求,并为指定元素生成具有高可控性的样本,同时保持对未指定元素的多样性。我们将任务建模为变分推断,以近似组成分布,利用多个视频生成主干网络综合考虑所有任务约束。为解决优化挑战,我们将问题分解为在逐步 annealed 分布序列上的 KL 发散最小化,并进一步提出一种情境条件分解技术,以减少解空间的模式,从而规避局部最优。实验表明,我们的方法在可控性、多样性和 3D 一致性方面均优于先前方法。

关键词

引用

@article{arxiv.2510.07670,
  title  = {Ctrl-VI: Controllable Video Synthesis via Variational Inference},
  author = {Haoyi Duan and Yunzhi Zhang and Yilun Du and Jiajun Wu},
  journal= {arXiv preprint arXiv:2510.07670},
  year   = {2025}
}

备注

Project page: https://video-synthesis-variational.github.io/