中文

NoScope:面向大规模视频的神经网络查询优化

数据库 2017-08-10 v3 计算机视觉与模式识别

摘要

计算机视觉的最新进展——以深度神经网络的形式——使得以高准确度查询不断增长的视频数据量成为可能。然而,神经网络推理在大规模下计算代价高昂:将最先进的物体检测器实时(即30+帧每秒)应用于单个视频需要一块 $4000 GPU。为此,我们提出 NoScope,一个用于查询视频的系统,它通过推理优化的模型搜索,可将神经网络视频分析的成本降低多达三个数量级。给定目标视频、待检测物体和参考神经网络,NoScope 自动搜索并训练一系列(或级联)模型,这些模型保持参考网络的准确度,但专门针对目标视频,因此计算代价远低于前者。NoScope 级联两类模型:专用模型,其放弃参考模型的全部通用性但忠实模仿其对目标视频和物体的行为;以及差异检测器,其突出帧间的时间差异。我们表明最优级联架构因视频和物体而异,因此 NoScope 使用高效的基于代价的优化器来搜索模型与级联。通过该方法,NoScope 在固定角度网络摄像头和监控视频的二分类任务上实现了两到三个数量级加速(265-15,500倍实时),同时将准确度保持在最先进神经网络的1-5%范围内。

关键词

引用

@article{arxiv.1703.02529,
  title  = {NoScope: Optimizing Neural Network Queries over Video at Scale},
  author = {Daniel Kang and John Emmons and Firas Abuzaid and Peter Bailis and Matei Zaharia},
  journal= {arXiv preprint arXiv:1703.02529},
  year   = {2017}
}

备注

PVLDB 2017