PARE:用于高效视频生成的剪枝与自适应路由
计算机视觉与模式识别
2026-05-27 v1
摘要
视频扩散变换器 (DiTs) 能够生成高质量视频,但由于宽块、深层结构和迭代采样的需求,计算资源较大。最近的研究方法通过压缩宽度、深度或采样步骤来降低成本,但通常会固定架构,无法适应 individual 输入或去噪阶段。我们提出了 PARE(Pruning and Adaptive Routing for Efficient video generation,即用于高效视频生成的剪枝与自适应路由),它联合通过结构感知剪枝和输入自适应路由来压缩宽度和深度。对于宽度,我们观察到注意力头会专业化为空间和时间角色,设计了考虑这一区别的重要性评分,以防止运动关键的时序头被过早剪枝。对于深度,我们训练一个轻量级路由器,依据去噪时间步和视觉内容,动态选择在每个步骤中要执行的块,从而实现 per-input 计算适应,而非静态块删除。一个渐进式管道首先通过蒸馏恢复宽度剪枝后的质量,然后联合优化学生和路由器以解耦两个学习目标。在针对 Wan2.1-14B 进行的图像到视频和文本到视频生成实验中显示,PARE 在 VBench 各维度上显著降低了每步计算量,同时保持了质量,并且可以与步骤蒸馏组合以进一步加速。
引用
@article{arxiv.2605.27336,
title = {PARE: Pruning and Adaptive Routing for Efficient Video Generation},
author = {Yutong Wang and Yunke Wang and Tianfan Xue and Yu Qiao and Yaohui Wang and Xinyuan Chen and Chang Xu},
journal= {arXiv preprint arXiv:2605.27336},
year = {2026}
}