中文

FlowLong:通过流形约束的Tweedie匹配实现推理时长视频生成

计算机视觉与模式识别 2026-05-21 v1

摘要

将视频扩散模型的生成范围扩展到长序列仍然是一个长期存在且重要的挑战。现有的免训练方法分为两类:双向模型的扩展,它们与特定架构紧密耦合,并且在长范围上遭受质量退化;以及自回归模型,它们由于曝光偏差而累积漂移误差,并倾向于产生重复的运动模式。为了解决这些问题,我们提出了一种新颖但简单的推理时长视频生成方法,该方法与架构无关且无需额外训练。我们的方法通过重叠滑动窗口生成长视频,其中来自相邻窗口的预测干净样本通过\textit{Tweedie匹配}进行混合,以在重叠区域强制执行\textbf{流形约束和时间一致性}。然后,\textit{随机早期阶段采样}通过在Tweedie匹配校正后的高噪声阶段注入新噪声来同步每个窗口的轨迹,然后过渡到确定性ODE采样以保留精细的视觉保真度。应用于各种视频生成模型,我们的方法生成了比原生窗口长度长数倍的视频,同时在时间一致性和视觉质量上优于免训练和自回归基线,并且无需任何微调即可进一步扩展到音频-视频联合生成和文本到3DGS。

关键词

引用

@article{arxiv.2605.20910,
  title  = {FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching},
  author = {Jangho Park and Geon Yeong Park and Gihyun Kwon and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2605.20910},
  year   = {2026}
}

备注

Project Page: https://flowlong-video.github.io/