中文

PipeFlow: 面向长视频编辑的流水线处理与运动感知帧选择

计算机视觉与模式识别 2026-01-01 v1 人工智能

摘要

由于联合编辑和去噪扩散隐式模型 (DDIM) 逆过程在长序列上的计算成本呈指数级增长,长视频编辑带来了独特的挑战。为了解决这些局限性,我们提出了 PipeFlow,一种可扩展的流水线视频编辑方法,该方法引入了三项关键创新:首先,基于使用结构相似性指数度量 (SSIM) 和光流进行的运动分析,我们识别并提议跳过对低运动帧的编辑。其次,我们提出了一种流水线任务调度算法,该算法将视频分割为多个片段,并基于可用 GPU 内存并行执行 DDIM 逆过程和联合编辑。最后,我们利用基于神经网络的插值技术来平滑片段间的边界帧,并对先前跳过的帧进行插值。我们的方法通过将长视频分割为较小的片段,独特地实现了对更长视频的可扩展性,使得 PipeFlow 的编辑时间随视频长度线性增长。从原理上讲,这使得编辑无限长视频成为可能,而不会遇到其他方法中不断增长的每帧计算开销。与 TokenFlow 相比,PipeFlow 实现了高达 9.6 倍的加速,与 Diffusion Motion Transfer (DMT) 相比实现了 31.7 倍的加速。

关键词

引用

@article{arxiv.2512.24026,
  title  = {PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing},
  author = {Mustafa Munir and Md Mostafijur Rahman and Kartikeya Bhardwaj and Paul Whatmough and Radu Marculescu},
  journal= {arXiv preprint arXiv:2512.24026},
  year   = {2026}
}