中文

Pusa V1.0:基于向量化时间步适应解锁预训练视频扩散模型中的时间控制

计算机视觉与模式识别 2026-05-27 v2

摘要

视频扩散模型的快速发展受到时间建模中的根本性限制,尤其是由常规标量时间步变量强制执行的帧演化同步问题。虽然任务特定的适应和自回归模型试图解决这些挑战,但仍受计算效率低下、不可逆遗忘或适用范围狭窄的制约。本文提出了 \textbf{Pusa} V1.0,一种利用 \textbf{向量化时间步适应(VTA)} 实现统一视频扩散框架内精细时间控制的通用模型。值得注意的是,VTA 是一种非破坏性的适应方式,这意味着它完全保留了基础模型的能力。与 Wan-I2V 等常规方法不同,后者通过大量资源对基础文本到视频(T2V)模型进行微调以实现图像到视频(I2V),我们仅通过基于 VTA 的超高效微调即可以零样本方式获得相当效果。此外,该方法还同时解锁了许多其他零样本能力,如起始-结束帧和视频扩展——无需任务特定训练。同时保留了基础模型的 T2V 能力。机制分析还表明,我们的方法在保留基础模型生成先验的同时,通过手术式注入时间动力学,避免了向量化时间步所固有的组合爆炸问题。这一工作为下一代视频合成树立了可扩展、高效且通用的范式,使研究和行业 alike 都能实现高保真度视频生成。

关键词

引用

@article{arxiv.2507.16116,
  title  = {Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation},
  author = {Yaofang Liu and Yumeng Ren and Aitor Artola and Yuxuan Hu and Xiaodong Cun and Xiaotong Zhao and Alan Zhao and Raymond H. Chan and Suiyun Zhang and Rui Liu and Dandan Tu and Jean-Michel Morel},
  journal= {arXiv preprint arXiv:2507.16116},
  year   = {2026}
}

备注

Code is open-sourced at https://github.com/Yaofang-Liu/Pusa-VidGen