在高效视频识别语境下重新思考分辨率
计算机视觉与模式识别
2022-09-27 v1
摘要
在本文中,我们实证研究了如何充分利用低分辨率帧以实现高效视频识别。现有方法主要关注开发紧凑网络或缓解视频输入的时间冗余以提升效率,而压缩帧分辨率很少被视为一种有前景的方案。一个主要担忧是低分辨率帧上的识别精度较差。因此我们首先分析低分辨率帧性能退化的潜在原因。我们的关键发现是,退化的主要原因并非下采样过程中的信息丢失,而是网络架构与输入尺度之间的不匹配。受知识蒸馏(KD)成功的启发,我们提出通过跨分辨率KD(ResKD)来弥合网络与输入尺寸之间的差距。我们的工作表明,ResKD是一种简单但有效的方法,可提升低分辨率帧上的识别精度。无需额外技巧,ResKD在四个大规模基准数据集(即ActivityNet、FCVID、Mini-Kinetics、Something-Something V2)的效率与精度上大幅超越所有竞争方法。此外,我们广泛展示了其在最先进架构(即3D-CNNs与Video Transformers)上的有效性,以及对超低分辨率帧的可扩展性。结果表明ResKD可作为最先进视频识别的通用推理加速方法。我们的代码将发布于https://github.com/CVMI-Lab/ResKD。
引用
@article{arxiv.2209.12797,
title = {Rethinking Resolution in the Context of Efficient Video Recognition},
author = {Chuofan Ma and Qiushan Guo and Yi Jiang and Zehuan Yuan and Ping Luo and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2209.12797},
year = {2022}
}
备注
Accepted by NIPS2022