AceVFI:视频帧插值进展的全面综述
计算机视觉与模式识别
2026-03-27 v3
摘要
视频帧插值(VFI)是一项核心的低级视觉任务,旨在在现有帧之间合成中间帧,同时确保空间和时间上的连贯性。在过去的几十年里,VFI 方法已经从经典的基于运动补偿的方法演变为广泛的基于深度学习的方法,包括基于核、基于流、混合、基于相位、GAN、Transformer、Mamba 以及最近的基于扩散的模型。我们引入了 AceVFI,一份关于 VFI 领域的全面且最新的综述,涵盖了 250 多篇代表性论文。我们根据 VFI 方法的核心设计原理和架构特征对其进行了系统分类。此外,我们将它们分为两种主要的学习范式:中心时间帧插值(CTFI)和任意时间帧插值(ATFI)。我们分析了 VFI 中的关键挑战,包括大运动、遮挡、光照变化和非线性运动。此外,我们回顾了标准数据集、损失函数和评估指标。我们还探讨了 VFI 在其他领域的应用,并重点介绍了未来的研究方向。本综述旨在为寻求深入了解现代 VFI 领域的研究人员和从业者提供有价值的参考。
引用
@article{arxiv.2506.01061,
title = {AceVFI: A Comprehensive Survey of Advances in Video Frame Interpolation},
author = {Dahyeon Kye and Changhyun Roh and Sukhun Ko and Chanho Eom and Jihyong Oh},
journal= {arXiv preprint arXiv:2506.01061},
year = {2026}
}
备注
Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). Please visit our project page at https://github.com/CMLab-Korea/Awesome-Video-Frame-Interpolation