中文

语义帧插值

计算机视觉与模式识别 2025-07-08 v1

摘要

基于给定的首帧和末帧以及文本提示信息生成不同长度的中间视频内容,具有重要的研究和应用潜力。然而,传统的帧插值任务主要关注帧数少、无文本控制以及首末帧差异小的场景。近期社区开发者利用以 Wan 为代表的大型视频模型赋予了帧到帧的能力。然而,这些模型只能生成固定数量的帧,并且对于某些帧长度往往无法产生令人满意的结果,同时这种设置缺乏明确的官方定义和成熟的基准。在本文中,我们首先从学术定义的角度提出了一项新的实用任务——语义帧插值(SFI),该任务涵盖了上述两种设置,并支持多帧率的推理。为实现这一目标,我们基于 Wan2.1 提出了一种新颖的 SemFi 模型,该模型集成了混合 LoRA 模块,以确保在各种帧长度限制下生成与控制条件高度一致的内容。此外,我们提出了 SFI-300K,这是首个专为 SFI 设计的通用数据集和基准。为此,我们从 SFI 的角度收集和处理数据,精心设计了评估指标和方法,以从多个维度(包括图像和视频)以及多个方面(包括一致性和多样性)评估模型的性能。通过在 SFI-300K 上的大量实验,我们证明了我们的方法特别适合满足 SFI 任务的要求。

关键词

引用

@article{arxiv.2507.05173,
  title  = {Semantic Frame Interpolation},
  author = {Yijia Hong and Jiangning Zhang and Ran Yi and Yuji Wang and Weijian Cao and Xiaobin Hu and Zhucun Xue and Yabiao Wang and Chengjie Wang and Lizhuang Ma},
  journal= {arXiv preprint arXiv:2507.05173},
  year   = {2025}
}

备注

https://github.com/hyj542682306/Semantic-Frame-Interpolation