中文

SVG-EAR:基于误差感知路由的稀疏视频生成无参数线性补偿

计算机视觉与模式识别 2026-03-11 v1

摘要

扩散转换器(DiTs)已成为视频生成的主要 Backbone,但其二次注意力成本仍是主要瓶颈。稀疏注意力通过仅计算注意力块的子集来降低此成本。然而,先前方法要么丢弃剩余块,导致信息损失,要么依赖学习的预测器来近似这些块,引入训练开销并可能导致输出分布偏移。本文表明,遗漏的贡献可在不进行训练的情况下恢复:在语义聚类之后,每个块内的键和值 exhibits 强烈相似性,可被小型聚类质心良好地概括。基于此观察,我们引入 SVG-EAR,这是一个无参数的线性补偿分支,使用质心来近似被跳过的块并恢复其贡献。尽管质心补偿对大多数块都很准确,但在小数子集上可能会失败。标准稀疏化通常按注意力得分选择块,这表明模型放置了注意力质量,但并非近似误差最大的地方。SVG-EAR 因此执行误差感知路由:一个轻量探针估计每个块的补偿误差,我们计算具有最高误差/成本比的块并对被跳过的块进行补偿。我们提供了将注意力重建误差与聚类质量相关的理论保证,实证表明 SVG-EAR 在能效-质量权衡方面取得改进,在相同的生成保真度下提高了吞吐量。总体而言,SVG-EAR 在先前方法的 Pareto 前沿上建立了清晰的局限,实现了最高可达 1.77×1.77\times1.93×1.93\times 的加速,在 Wan2.2 和 HunyuanVideo 上分别保持 PSNR 最高可达 29.759 和 31.043。

关键词

引用

@article{arxiv.2603.08982,
  title  = {SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing},
  author = {Xuanyi Zhou and Qiuyang Mang and Shuo Yang and Haocheng Xi and Jintao Zhang and Huanzhi Mao and Joseph E. Gonzalez and Kurt Keutzer and Ion Stoica and Alvin Cheung},
  journal= {arXiv preprint arXiv:2603.08982},
  year   = {2026}
}