中文

通过对象级整合实现大规模视频分析

计算机视觉与模式识别 2021-12-01 v1 网络与互联网体系结构

摘要

随着已安装摄像头数量的增长,处理和分析这些摄像头捕获的所有图像所需的计算资源也在增长。视频分析实现了智能城市或自动驾驶等新用例。同时,它迫使服务提供商安装额外的计算资源以应对需求,而严格的延迟要求将计算推向网络边缘,形成地理上分布式且异构的一组计算位置,这些位置共享且资源受限。这种格局(共享且分布式的地点)迫使我们设计新的技术,能够在所有可用位置间优化和分配工作,并理想地使计算需求相对于已安装摄像头数量呈亚线性增长。本文中,我们提出 FoMO(Focus on Moving Objects)。该方法通过为场景预处理图像、滤除空白区域,并将来自多个摄像头感兴趣区域合成为单张图像作为预训练目标检测模型的输入,有效优化多摄像头部署。结果显示,整体系统性能可提升 8 倍,同时作为该方法副产品准确率提高 40%,全部使用现成预训练模型,无需额外训练或微调。

关键词

引用

@article{arxiv.2111.15451,
  title  = {Large-Scale Video Analytics through Object-Level Consolidation},
  author = {Daniel Rivas and Francesc Guim and Jordà Polo and David Carrera},
  journal= {arXiv preprint arXiv:2111.15451},
  year   = {2021}
}