LeMiCa:基于词典最小最大路径缓存的高效扩散视频生成
计算机视觉与模式识别
2025-12-12 v3 人工智能
摘要
我们提出 LeMiCa,一种面向扩散视频生成的无训练且高效加速框架。虽然现有缓存策略主要关注减少局部启发式误差,却往往忽视全局误差的累积,导致加速后视频与原始视频之间内容 degradation 明显。为解决此问题,我们将缓存调度建模为带误差加权边的有向图,引入词典最小最大路径优化策略,以显式界定最坏情况路径误差。该方法在生成帧的全局内容和风格一致性方面实现了显著提升。广泛的实验在多个文本到视频基准上表明,LeMiCa 在推理速度和生成质量方面实现了双重改进。值得注意的是,该方法在 Latte 模型上实现 2.9 倍加速,在 Open-Sora 上达到 LPIPS 分数 0.05,超越了先前的缓存技术。重要的是,这些收益以最小的感知质量退化实现,使 LeMiCa 成为加速扩散视频生成的稳健且通用的范式。我们认为该方法可为未来高效可靠视频合成研究提供强大的基础。我们的代码已在 https://github.com/UnicomAI/LeMiCa 提供。
引用
@article{arxiv.2511.00090,
title = {LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation},
author = {Huanlin Gao and Ping Chen and Fuyuan Shi and Chao Tan and Zhaoxiang Liu and Fang Zhao and Kai Wang and Shiguo Lian},
journal= {arXiv preprint arXiv:2511.00090},
year = {2025}
}
备注
NeurIPS 2025 Spotlight