中文

迈向基于自回归扩散 Transformer 的视频帧插值整体建模

计算机视觉与模式识别 2026-03-31 v2

摘要

现有的视频帧插值方法通常采用以帧为中心的方法,将视频作为独立的短片段(如三元组)进行处理,这会导致时间不一致性和运动伪影。为克服这一问题,我们提出了一种以视频为中心的整体范式,命名为用于视频帧插值的局部扩散强制(Local Diffusion Forcing for Video Frame Interpolation, LDF-VFI)。我们的框架建立在自回归扩散 Transformer 之上,对整个视频序列进行建模以确保长程时间连贯性。为缓解自回归生成中固有的误差累积,我们引入了一种新颖的跳跃拼接采样策略,有效维持了时间稳定性。此外,LDF-VFI 结合了稀疏局部注意力和分块 VAE 编码,这种组合不仅能够高效处理长序列,还允许在推理时无需重新训练即可泛化至任意空间分辨率(如 4K)。增强的条件 VAE 解码器利用输入视频的多尺度特征,进一步提升了重建保真度。实验表明,LDF-VFI 在具有挑战性的 VFI 基准上取得了 SOTA 性能,展现出卓越的逐帧质量和时间一致性,尤其是在大运动场景中。源代码可在 https://github.com/xypeng9903/LDF-VFI 获取。

关键词

引用

@article{arxiv.2601.14959,
  title  = {Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers},
  author = {Xinyu Peng and Han Li and Yuyang Huang and Ziyang Zheng and Yaoming Wang and Xin Chen and Wenrui Dai and Chenglin Li and Junni Zou and Hongkai Xiong},
  journal= {arXiv preprint arXiv:2601.14959},
  year   = {2026}
}