中文

超越边界帧:基于音视频语义的上下文中心视频插帧

计算机视觉与模式识别 2026-04-01 v2

摘要

视频帧插值长期以来面临可控性和交互性受限的挑战,尤其是在涉及快速、高度非线性及细粒度运动的场景中。尽管近期的交互式插值方法取得了进展,但它们仍主要基于边界帧视角,忽略了起始帧和结束帧之外的辅助上下文信号,导致输出偏离用户预期目标。为解决这一问题,我们将 VFI 从边界中心任务重新表述为上下文中心生成问题。基于此,我们提出了 BBF(Beyond Boundary Frames),一个具有解耦多模态条件化的上下文中心视频帧插值框架,联合利用端点相邻视觉上下文、文本语义和音频相关时间动力学。为平衡端点一致性与上下文依赖的时间演化,BBF 进一步引入了多流上下文集成机制,包括端点约束集成、演化先验集成和时间上下文集成。此外,BBF 采用渐进训练策略以稳定多模态学习并提升可控插值。大量实验表明,BBF 在通用插值和音视频同步生成任务上均优于专门的最先进方法,建立了一个在协调多模态条件化下的视频帧插值统一框架。代码、模型和界面将公开发布以促进进一步研究。

关键词

引用

@article{arxiv.2512.03590,
  title  = {Beyond Boundary Frames: Context-Centric Video Interpolation with Audio-Visual Semantics},
  author = {Yuchen Deng and Xiuyang Wu and Hai-Tao Zheng and Jie Wang and Feidiao Yang and Yuxing Han},
  journal= {arXiv preprint arXiv:2512.03590},
  year   = {2026}
}