中文

面向恢复的视频帧插值:利用SAM的区域可区分先验

计算机视觉与模式识别 2026-05-08 v3

摘要

在现有的面向恢复的视频帧插值方法中,相邻帧之间的运动估计起着关键作用。然而,现有方法中的估计精度仍然是一个挑战,主要是由于在插值过程中识别相邻帧中对应区域的固有模糊性。因此,在运动估计之前通过区分不同区域来提高精度至关重要。在本文中,我们引入了一种新颖的解决方案,涉及利用开放世界分割模型(例如SAM2)对帧进行处理,以在不同帧中导出区域可区分先验。这些RDP表示为空间变化的高斯混合,以统一模态区分任意数量的区域。RDP可以集成到现有的基于运动的VFI方法中,以增强运动估计的特征,这得益于我们设计的即插即用分层区域感知特征融合模块。HRFFM将RDP纳入VFI编码器的各个层次阶段,使用残差学习方式的RDP引导特征归一化。通过HRFFM和RDP,VFI编码器内的特征对相邻帧中匹配的区域表现出相似的表示,从而改善了中间帧的合成。大量实验表明,HRFFM在各种场景中一致地提升了VFI性能。

关键词

引用

@article{arxiv.2312.15868,
  title  = {Restoration-Oriented Video Frame Interpolation with Region-Distinguishable Priors from SAM},
  author = {Yan Han and Xiaogang Xu and Yingqi Lin and Jiafei Wu and Zhe Liu and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2312.15868},
  year   = {2026}
}

备注

Code will be released