中文

TKD:面向主动感知的时间知识蒸馏

计算机视觉与模式识别 2020-01-08 v2

摘要

基于深度神经网络的方法已被证明在目标检测与分类任务上取得了卓越性能。尽管性能显著提升,但由于深层结构,它们仍需极高的运行时间来处理图像,并为实时应用维持尽可能高的性能。观察到人类视觉系统(HVS)高度依赖视觉输入中帧间的时间依赖关系来高效完成识别,我们提出了一种新颖框架,称为TKD:时间知识蒸馏。该框架将基于重型神经网络模型在选定视频帧(时刻的感知)上的时间知识蒸馏到一个轻量模型。为支持蒸馏,我们提出两种新流程:1) 基于长短期记忆(LSTM)的关键帧选择方法;2) 一种新颖的受教师模型约束的损失设计。为验证,我们使用不同的目标检测方法在多个数据集(包括Youtube-Objects和Hollywood场景数据集)上进行了全面的实证评估。结果表明,相较于其他现代目标识别方法,我们在动态场景帧上的目标检测精度-速度权衡得到了一致改善。

关键词

引用

@article{arxiv.1903.01522,
  title  = {TKD: Temporal Knowledge Distillation for Active Perception},
  author = {Mohammad Farhadi and Yezhou Yang},
  journal= {arXiv preprint arXiv:1903.01522},
  year   = {2020}
}