面向边缘视频分析的自动模型专用化
计算机视觉与模式识别
2021-12-14 v2 机器学习
图像与视频处理
摘要
从 ImageNet 或 PASCAL VOC 等流行且通用的计算机视觉挑战赛来看,神经网络在识别任务中已证明具有极高的准确性。然而,最先进的精度往往伴随高昂的计算代价,需要硬件加速才能实现实时性能,而诸如智慧城市等用例要求对固定摄像头的图像进行实时分析。由于这些视频流会产生大量网络带宽,我们无法依赖将计算卸载到集中式云。因此,分布式边缘云需在本地处理图像。但边缘天然资源受限,这限制了可执行的计算复杂度。然而,边缘与精确的实时视频分析之间亟需一个交汇点。按摄像头逐个专用化轻量模型或有所帮助,但随着摄像头数量增长会迅速变得不可行,除非该过程实现自动化。本文提出并评估 COVA(上下文优化视频分析),一个用于辅助边缘摄像头视频分析模型自动专用化的框架。COVA 通过对轻量模型进行专用化来自动提升其精度。此外,我们讨论并审视该过程中的每个步骤,以理解各自带来的不同权衡。我们还展示,仅凭借静态摄像头这一假设,便可做出一系列极大简化问题范围的考量。最后,实验表明,能够泛化至未知环境的最先进模型可有效作为教师,将更小网络裁剪至特定上下文,在以恒定计算成本提升精度的同时提高准确性。结果显示,我们的 COVA 能自动将预训练模型精度平均提升 21%。
引用
@article{arxiv.2104.06826,
title = {Towards Automatic Model Specialization for Edge Video Analytics},
author = {Daniel Rivas and Francesc Guim and Jordà Polo and Pubudu M. Silva and Josep Ll. Berral and David Carrera},
journal= {arXiv preprint arXiv:2104.06826},
year = {2021}
}