Salt:基于缓存感知训练的自一致分布匹配快速视频生成
计算机视觉与模式识别
2026-04-06 v1 图像与视频处理
摘要
将视频生成模型蒸馏至极低推理预算(如2--4个NFE)对于实际部署至关重要,但仍具挑战性。基于轨迹风格的一致性蒸馏在复杂视频动力学下常显得保守,导致外观过于平滑且运动较弱。分布匹配蒸馏(DMD)可恢复锐利、寻求模式的样本,但其局部训练信号未显式正规化去噪更新在时间步之间的组成方式,导致组合滚动易漂移。为克服这一挑战,我们提出了自一致分布匹配蒸馏(SC-DMD),显式正规化连续去噪更新的端点一致性组成。对于实时自回归视频生成,我们进一步将KV缓存视为质量参数化条件,提出缓存感知分布训练。该训练方案在多步滚动上应用SC-DMD,并引入缓存条件化特征对齐目标,将低质量输出引导至高质量参考。跨越大量实验在非自回归背bone(如Wan~2.1)和自回归实时范式(如Self Forcing)上,我们的方法称之为\textbf{Salt},始终改善了低NFE视频生成质量,同时与多样化KV缓存内存机制保持兼容。
引用
@article{arxiv.2604.03118,
title = {Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation},
author = {Xingtong Ge and Yi Zhang and Yushi Huang and Dailan He and Xiahong Wang and Bingqi Ma and Guanglu Song and Yu Liu and Jun Zhang},
journal= {arXiv preprint arXiv:2604.03118},
year = {2026}
}
备注
under review