中文

Veda:通过蒸馏稀疏注意力实现可扩展视频扩散

计算机视觉与模式识别 2026-05-29 v1

摘要

将扩散变换器扩展以生成高分辨率、长时长视频受到自注意力二次成本的限制,而现有稀疏注意力方法在高稀疏性下会性能 degradation。我们通过实验发现,生成质量并非由稀疏比率本身决定,而是由稀疏掩码是否与完整注意力的瓦片式几何良好对齐所决定。基于这一洞察,我们提出了 Veda,这是一个蒸馏稀疏注意力框架,将瓦片选择形式化为从完整注意力进行重建的显式问题。Veda 集成了统计感知的瓦片评分与头部感知的瓦片划分,以减少估计误差和结构错位,实现激进的稀疏化。硬件高效的瓦片跳过内核将理论稀疏化转化为实际的 wall-clock 加速。在大型视频扩散模型(包括 Waver 和 Wan2.1)上的实验表明,Veda 能实现显著的加速,且生成质量几乎无可见降低。对于 Waver-T2V-12B,Veda 实现了 5.1 倍端到端加速和 10.5 倍自注意力加速,将注意力开销从 92% 降至 50%。值得注意的是,随着序列长度增加,加速效果也随之提升,表明 Veda 在空间-时间分辨率跨模型间具备良好的可扩展性。

关键词

引用

@article{arxiv.2605.30325,
  title  = {Veda: Scalable Video Diffusion via Distilled Sparse Attention},
  author = {Shihao Han and Hao Yang and Xinting Hu and Xiaofeng Mei and Yi Jiang and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2605.30325},
  year   = {2026}
}

备注

Accepted to ICML 2026