用于高效估计航拍视频显著性的时空知识蒸馏
计算机视觉与模式识别
2020-01-08 v1
摘要
随着卷积神经网络(CNNs)的快速发展,视频显著性估计技术的性能取得了显著进步。然而,相机和无人机等设备的计算能力与存储空间可能有限,使得直接部署复杂的深度显著性模型变得不可行。为解决该问题,本文提出一种通过时空知识蒸馏实现航拍视频动态显著性估计的方法。该方法包含五个组件:两个教师模型、两个学生模型以及目标时空模型。空间与时间显著性的知识首先分别从两个复杂且冗余的教师模型迁移至其简单紧凑的学生模型,同时输入场景由高分辨率降至低分辨率以去除可能的数据冗余,从而大幅加速特征提取过程。此后,通过将两个学生模型的空间与时间显著性知识蒸馏并编码至统一网络,进一步训练目标时空模型。以此方式,可进一步去除模型间冗余,实现对航拍视频动态显著性的有效估计。实验结果表明,所提方法在航拍视频视觉显著性估计上优于十种当前最优模型,同时其在GPU平台上的速度可达28,738 FPS。
引用
@article{arxiv.1904.04992,
title = {Spatiotemporal Knowledge Distillation for Efficient Estimation of Aerial Video Saliency},
author = {Jia Li and Kui Fu and Shengwei Zhao and Shiming Ge},
journal= {arXiv preprint arXiv:1904.04992},
year = {2020}
}