基于耦合知识蒸馏的超快视频注意力预测
计算机视觉与模式识别
2020-01-03 v2
摘要
大型卷积神经网络模型近来在视频注意力预测上展现出令人印象深刻的性能。通常,这些模型计算密集且占用大量内存。为解决这些问题,我们设计了一个极轻量、具有超快速度的网络,称为 UVA-Net。该网络基于深度可分离卷积构建,并以低分辨率图像作为输入。然而,这种直接的加速方法会显著降低性能。为此,我们提出一种耦合知识蒸馏策略来有效增强并训练该网络。借助该策略,模型可进一步自动发现并强调数据中隐含的有用线索。由高分辨率复杂教师网络学到的空间与时间知识也可被蒸馏并迁移到所提出的低分辨率轻量时空网络中。实验结果表明,我们的模型在视频注意力预测上的性能可与 11 个 SOTA 模型相媲美,而其内存占用仅 0.68 MB,在 GPU 上运行约 10,106 FPS、在 CPU 上运行 404 FPS,比先前模型快 206 倍。
引用
@article{arxiv.1904.04449,
title = {Ultrafast Video Attention Prediction with Coupled Knowledge Distillation},
author = {Kui Fu and Peipei Shi and Yafei Song and Shiming Ge and Xiangju Lu and Jia Li},
journal= {arXiv preprint arXiv:1904.04449},
year = {2020}
}