中文

Edit2Interp:从空间编辑适配图像基础模型到视频帧插值( Few-Shot 学习版)

计算机视觉与模式识别 2026-03-17 v1

摘要

预训练的图像编辑模型展现出强大的空间推理和对象感知转换能力,这些能力源于数十亿的图像-文本配对,但缺乏显式的时间建模。本文表明,这些空间先验可以通过最小化适配揭示其时间合成能力——无需引入任何视频特定的体系结构或运动估计模块。我们展示,大型图像编辑模型(Qwen-Image-Edit)原本为静态指令式编辑设计,仅通过少量微调(64-256个训练样本)即可适配用于视频帧插值(VFI)。我们的核心贡献在于揭示,该模型内在对“对象如何转换”的静态场景理解包含可被激活的潜在时间推理能力。虽然基线模型在生成连贯的中间帧方面完全失败,但我们的高效参数适配方法成功地解锁了其插值能力。与在大规模数据集上从零训练的任务特定VFI方法不同,我们的工作表明,基础图像编辑模型具备未被充分挖掘的时序任务潜力,为资源受限场景下的视频合成提供了数据高效的路径。这一发现弥合了图像操作与视频理解之间的鸿沟,暗示空间推理与时间推理在基础模型中可能存在更深层的内在联系。

关键词

引用

@article{arxiv.2603.15003,
  title  = {Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning},
  author = {Nasrin Rahimi and Mısra Yavuz and Burak Can Biner and Yunus Bilge Kurt and Ahmet Rasim Emirdağı and Süleyman Aslan and Görkay Aydemir and M. Akın Yılmaz and A. Murat Tekalp},
  journal= {arXiv preprint arXiv:2603.15003},
  year   = {2026}
}