中文

增强用于一致长视频的无训练无限帧生成

计算机视觉与模式识别 2026-05-19 v1

摘要

在不产生显著计算开销的情况下,无训练长视频生成旨在使基础视频生成模型能够生成更长的视频。帧级自回归框架(例如 FIFO-diffusion)具有以恒定内存消耗生成无限长视频的优势。然而,训练与推理之间的不匹配,加上保持长期一致性的挑战,限制了基础模型的有效利用。为了缓解这些问题,我们提出了 \textbf{MIGA},一种新颖的无限帧长视频生成方法。首先,我们提出了一种有效的两阶段对齐机制,通过减少馈入模型的过度噪声跨度来缓解训练-推理差距。然后,我们引入了一种创新的双重一致性增强机制,其中自反思方法纠正早期的高噪声帧,而长程帧引导方法利用具有广泛覆盖范围的后期低噪声帧来引导生成,共同提高时间一致性。在 VBench 和 NarrLV 上的大量实验证明了 MIGA 的 SOTA 性能。我们的项目页面位于 https://xiaokunfeng.github.io/miga_homepage/。

关键词

引用

@article{arxiv.2605.18233,
  title  = {Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos},
  author = {X. Feng and J. Zhu and M. Wu and C. Chen and F. Mao and H. Guo and J. Wu and X. Chu and K. Huang},
  journal= {arXiv preprint arXiv:2605.18233},
  year   = {2026}
}

备注

Accepted by ICML 2026~