中文

用于高效视频推理的在线模型蒸馏

计算机视觉与模式识别 2020-01-29 v2

摘要

高质量的计算机视觉模型通常致力于理解真实世界图像的一般分布。然而,大多数相机仅观察到该分布的极小一部分。这提供了一种可能性,即通过将紧凑、低成本的模型专门适配到单个相机观察到的特定帧分布,来实现更高效的推理。在本文中,我们采用模型蒸馏技术(使用高成本教师模型的输出监督低成本学生模型),将准确、低成本的语义分割模型专门适配到目标视频流。我们不是在来自视频流的离线数据上学习专门化的学生模型,而是在实时视频上以在线方式训练学生模型,间歇性地运行教师模型以提供学习目标。在线模型蒸馏生成的语义分割模型能够紧密逼近其 Mask R-CNN 教师模型,且推理运行时成本降低了 7 至 17 倍(FLOPs 降低了 11 至 26 倍),即使目标视频的分布是非平稳的也是如此。我们的方法无需在目标视频流上进行离线预训练,比基于光流或视频目标分割的解决方案实现了更高的准确率和更低的成本,并且可以展现出比原始教师模型更好的时间稳定性。我们还提供了一个新的视频数据集,用于评估在长时间运行的视频流上的推理效率。

关键词

引用

@article{arxiv.1812.02699,
  title  = {Online Model Distillation for Efficient Video Inference},
  author = {Ravi Teja Mullapudi and Steven Chen and Keyi Zhang and Deva Ramanan and Kayvon Fatahalian},
  journal= {arXiv preprint arXiv:1812.02699},
  year   = {2020}
}