中文

下一帧预测视频扩散模型中的帧上下文打包与漂移预防

计算机视觉与模式识别 2025-10-16 v3

摘要

我们提出一种神经网络结构FramePack,用于训练下一帧(或下一帧段)预测模型以生成视频。FramePack通过帧重要性压缩输入帧上下文,使固定上下文长度内能够编码更多帧,具有更高重要性的帧具有更长的上下文。帧重要性可通过时间接近性、特征相似性或混合度量来衡量。该打包方法允许进行数千帧的推理,并使用相对较大的批量大小进行训练。我们还提出了漂移预防方法以解决观察偏差(误差累积),包括早期确定的端点、调整的采样顺序和离散历史表示。消化研究验证了抗漂移方法在单向视频流和双向视频生成中的有效性。最后,我们表明现有的视频扩散模型可以用FramePack进行微调,并分析不同打包计划之间的差异。

关键词

引用

@article{arxiv.2504.12626,
  title  = {Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models},
  author = {Lvmin Zhang and Shengqu Cai and Muyang Li and Gordon Wetzstein and Maneesh Agrawala},
  journal= {arXiv preprint arXiv:2504.12626},
  year   = {2025}
}

备注

https://github.com/lllyasviel/FramePack