SwiftVideo:通过轨迹-分布对齐实现少步视频生成的统一框架
计算机视觉与模式识别
2025-09-18 v2
摘要
基于扩散或流的模型在视频合成方面取得了显著进展,但需要多次迭代采样步骤,这带来了巨大的计算开销。虽然已经开发了许多仅基于轨迹保持或分布匹配的蒸馏方法来加速视频生成模型,但这些方法在少步设置下常常会出现性能下降或伪影增多的问题。为了解决这些局限性,我们提出了 SwiftVideo,一个统一且稳定的蒸馏框架,它结合了轨迹保持和分布匹配策略的优势。我们的方法引入了连续时间一致性蒸馏,以确保精确保持 ODE 轨迹。随后,我们提出了一种双重视角对齐,包括合成数据与真实数据之间的分布对齐,以及不同推理步骤之间的轨迹对齐。我们的方法在保持高质量视频生成的同时,大幅减少了推理步骤的数量。在 OpenVid-1M 基准上的定量评估表明,我们的方法在少步视频生成方面显著优于现有方法。
引用
@article{arxiv.2508.06082,
title = {SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment},
author = {Yanxiao Sun and Jiafu Wu and Yun Cao and Chengming Xu and Yabiao Wang and Weijian Cao and Donghao Luo and Chengjie Wang and Yanwei Fu},
journal= {arXiv preprint arXiv:2508.06082},
year = {2025}
}