通过非对称融合实现面向感知的视频帧插值
计算机视觉与模式识别
2024-04-11 v1
摘要
以往的视频帧插值(VFI)方法遇到了挑战,特别是模糊和重影效应的出现。这些问题可归结为两个关键因素:不可避免的运动误差和监督中的不对齐。在实践中,运动估计往往容易出错,导致特征不对齐。此外,重建损失往往会带来模糊的结果,特别是在不对齐区域。为了缓解这些挑战,我们提出了一种名为 PerVFI(面向感知的视频帧插值)的新范式。我们的方法包含一个非对称协同融合模块(ASB),该模块利用两侧的特征协同融合中间特征。一个参考帧强调主要内容,而另一个提供互补信息。为了对融合过程施加严格约束,我们引入了一种自学习的稀疏准二值掩码,有效减轻了输出中的重影和模糊伪影。此外,我们采用了基于归一化流的生成器,并利用负对数似然损失来学习输出的条件分布,这进一步促进了清晰精细细节的生成。实验结果验证了 PerVFI 的优越性,表明与现有方法相比在感知质量上有显著提升。代码可在 \url{https://github.com/mulns/PerVFI} 获取。
引用
@article{arxiv.2404.06692,
title = {Perception-Oriented Video Frame Interpolation via Asymmetric Blending},
author = {Guangyang Wu and Xin Tao and Changlin Li and Wenyi Wang and Xiaohong Liu and Qingqing Zheng},
journal= {arXiv preprint arXiv:2404.06692},
year = {2024}
}
备注
Accepted by CVPR 2024