中文

VDOT:通过最优传输蒸馏实现高效统一视频创建

计算机视觉与模式识别 2025-12-23 v3

摘要

生成模型的快速发展显著推动了图像和视频应用的发展。在这些应用中,旨在各种条件下生成视频的视频创建受到广泛关注。然而,现有的视频创建模型要么仅聚焦于少数特定条件,要么因复杂模型推理导致生成时间过长,在实际应用中不够实用。为缓解这些问题,我们提出了一种高效统一视频创建模型,命名为 VDOT。具体而言,我们将训练过程建模为分布匹配蒸馏(DMD)范式。除了使用克尔默氏(Kullback-Leibler,KL)最小化外,我们还额外采用一种新型计算最优传输(OT)技术来优化真实与假记得分布之间的差异。OT距离本质上施加了几何约束,缓解了在少数步骤生成场景中可能出现的KL基于蒸馏的零压制或梯度崩溃问题,从而增强了蒸馏过程的效率和稳定性。进一步,我们集成了一个鉴别器,以使模型能够感知真实视频数据,从而提高生成视频的质量。为支持训练统一视频创建模型,我们提出了一个完全自动的视频数据标注和过滤管道,能够容纳多种视频创建任务。同时,我们策划了一个统一的测试基准 UVCBench,以标准化评估。实验表明,我们的4步 VDOT 在100个去噪步骤下表现出色,甚至可以与其他基线相当。

关键词

引用

@article{arxiv.2512.06802,
  title  = {VDOT: Efficient Unified Video Creation via Optimal Transport Distillation},
  author = {Yutong Wang and Haiyu Zhang and Tianfan Xue and Yu Qiao and Yaohui Wang and Chang Xu and Xinyuan Chen},
  journal= {arXiv preprint arXiv:2512.06802},
  year   = {2025}
}