FIS-DiT:通过免训练帧交错稀疏性突破少步视频推理障碍
计算机视觉与模式识别
2026-05-13 v1 机器学习
摘要
虽然视频扩散Transformer(DiT)的整体推理延迟可以通过模型蒸馏大幅降低,但每步推理延迟仍然是一个关键瓶颈。现有的加速范式主要利用去噪轨迹上的冗余;然而,我们发现了一个局限性,即这些逐步策略在少步机制中会遇到收益递减的问题。在这种情况下,时间状态的稀缺性阻碍了有效的特征重用或预测建模,从而为进一步加速制造了巨大的障碍。为了克服这一点,我们提出了帧交错稀疏性DiT(FIS-DiT),这是一个免训练且与算子无关的框架,它将优化焦点从时间轨迹转移到潜在帧维度。我们的方法受到该维度内一个内在对偶性的启发:存在允许减少计算的帧级稀疏性,同时伴随着一种结构一致性,即每个帧位置对全局时空上下文都同样至关重要。利用这一洞察,我们将帧交错稀疏性(FIS)作为一种执行策略来实现,该策略在模型层级中操作帧子集,刷新所有潜在位置,而无需进行全尺寸块计算。在Wan 2.2和HunyuanVideo 1.5上的实证评估表明,FIS-DiT在VBench-Q和CLIP指标上持续实现了2.11--2.41的加速,且性能下降可忽略不计,为实时高清视频生成提供了一条可扩展且稳健的路径。
引用
@article{arxiv.2605.11869,
title = {FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity},
author = {Jian Tang and Jiawei Fan and Qingbin Liu and Zheng Wei},
journal= {arXiv preprint arXiv:2605.11869},
year = {2026}
}