面向高分辨率视频帧插值的高效特征提取
计算机视觉与模式识别
2022-11-28 v1
摘要
大多数视频帧插值的深度学习方法由三个主要组件构成:特征提取、运动估计与图像合成。现有方法主要区别于这些模块的设计方式。然而,在插值高分辨率图像(如 4K)时,在合理内存需求内实现高精度的设计选择有限。特征提取层有助于压缩输入并为后续阶段(如运动估计)提取相关信息,但这些层常在参数、计算时间与内存上代价高昂。我们展示了如何结合降维思想与轻量优化来压缩输入表示,同时保持所提取信息适用于帧插值。此外,我们既不需要预训练光流网络也不需要合成网络,进一步减少了可训练参数数量与所需内存。在三个 4K 基准上评估时,我们在无预训练光流的方法中取得了最先进的图像质量,同时具有最低的网络复杂度与总体内存需求。
引用
@article{arxiv.2211.14005,
title = {Efficient Feature Extraction for High-resolution Video Frame Interpolation},
author = {Moritz Nottebaum and Stefan Roth and Simone Schaub-Meyer},
journal= {arXiv preprint arXiv:2211.14005},
year = {2022}
}
备注
Accepted to BMVC 2022. Code: https://github.com/visinf/fldr-vfi