中文

EF-VI:增强视频插帧的末端帧注入

计算机视觉与模式识别 2025-08-12 v2

摘要

视频插帧旨在以给定的首帧和末帧为条件,合成中间视频序列。当前的最先进方法主要通过直接微调或时间双向采样纳入末帧条件,从而扩展大规模预训练的图像到视频扩散模型(I2V-DMs)。然而,前者导致末帧约束较弱,而后者不可避免地破坏了视频帧的输入表示,导致次优性能。为了在增强末帧约束的同时避免破坏输入表示,我们提出了一种针对近期更强大的基于 Transformer 的 I2V-DMs 的新型视频插帧框架,称为 EF-VI。它通过利用增强的注入高效地强化末帧约束。这基于我们提出的精心设计的轻量级模块 EF-Net,该模块仅对末帧进行编码,并将其扩展为时间自适应的逐帧特征,注入到 I2V-DM 中。大量实验证明了我们的 EF-VI 相较于其他基线的优越性。

关键词

引用

@article{arxiv.2505.21205,
  title  = {EF-VI: Enhancing End-Frame Injection for Video Inbetweening},
  author = {Liuhan Chen and Xiaodong Cun and Xiaoyu Li and Xianyi He and Shenghai Yuan and Jie Chen and Ying Shan and Li Yuan},
  journal= {arXiv preprint arXiv:2505.21205},
  year   = {2025}
}

备注

17 pages, 11 figures