中文

USV:加速视频扩散模型的统一稀疏化

计算机视觉与模式识别 2025-12-08 v1

摘要

高保真视频扩散模型 (VDM) 的可扩展性受到两个关键冗余来源的制约:全局时空注意力的二次复杂度以及长迭代去噪轨迹的计算开销。现有加速器(如稀疏注意力和步骤蒸馏采样器)通常仅针对单一维度进行优化,很快就会遇到收益递减,因为剩余瓶颈将变得主导。本文引入 USV(Unified Sparsification for Video diffusion models),一个端到端可训练框架,通过在模型内部计算和其采样过程两个维度上协调稀疏化,克服了上述限制。USV 学习一个动态的、基于数据和时间步的稀疏化策略,对冗余注意力连接进行修剪,适应性地合并语义相似的 token,并减少去噪步骤,将其视为单个优化目标中的协调动作,而非独立的技巧。这种多维协同设计使先前 disjoint 的加速策略之间实现强大的相互强化。大规模视频生成基准测试的广泛实验表明,USV 在去噪过程中的加速最高可达 83.3%,端到端加速达 22.7%,同时保持高视觉保真度。我们的结果表明,统一、动态稀疏化是实现高质量视频生成高效路径的实用方法。

关键词

引用

@article{arxiv.2512.05754,
  title  = {USV: Unified Sparsification for Accelerating Video Diffusion Models},
  author = {Xinjian Wu and Hongmei Wang and Yuan Zhou and Qinglin Lu},
  journal= {arXiv preprint arXiv:2512.05754},
  year   = {2025}
}