中文

PyramidalWan:将预训练视频模型金字塔化以实现高效推理

计算机视觉与模式识别 2026-01-09 v1

摘要

近期提出的金字塔模型将传统的前向与逆向扩散过程分解为在不同分辨率下运行的多个阶段。这些模型在较低分辨率下处理具有较高噪声水平的输入,而在较高分辨率下处理噪声较小的输入。这种分层方法显著降低了多步去噪模型中推理的计算成本。然而,现有的开源金字塔视频模型均是从头训练的,在视觉合理性方面往往不如 SOTA 系统。在本研究中,我们提出了一种通过低成本微调将预训练扩散模型转换为金字塔模型的流程,在不降低输出视频质量的前提下实现了这一转换。此外,我们研究并比较了金字塔模型中步数蒸馏的各种策略,旨在进一步提升推理效率。我们的结果可在 https://qualcomm-ai-research.github.io/PyramidalWan 获取。

关键词

引用

@article{arxiv.2601.04792,
  title  = {PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference},
  author = {Denis Korzhenkov and Adil Karjauv and Animesh Karnewar and Mohsen Ghafoorian and Amirhossein Habibian},
  journal= {arXiv preprint arXiv:2601.04792},
  year   = {2026}
}