中文

基于物理表示的谓词优化用于视觉分析数据库

数据库 2019-04-23 v3 计算机视觉与模式识别

摘要

查询图像、视频及其他非文本数据源的内容需要昂贵的内容提取方法。现代提取技术基于深度卷积神经网络(CNN)并能以惊人准确度对图像中的物体进行分类。遗憾的是,这些方法速度慢:在现代基于GPU的硬件上处理单张图像约需10毫秒。随着海量视频库变得无处不在,在数百万视频帧上运行基于内容的查询令人望而却步。降低视觉内容查询运行成本的一种有前景的方法是使用分层模型,例如级联,其中简单情况由廉价分类器处理。先前工作试图通过例如使用更小CNN来设计优化推理计算成本的级联。然而,我们观察到除推理时间外还有关键因素会极大影响总体查询时间。值得注意的是,通过将输入图像的物理表示视为查询优化的一部分——即在级联中纳入图像变换,如分辨率缩放或色深降低——我们可以优化数据处理成本并实现显著更高效的分类器级联。本文中,我们提出Tahoma,它生成并评估许多潜在的分类器级联,联合优化CNN架构与输入数据表示。我们在ImageNet子集上的实验表明,Tahoma的输入变换将级联加速至多35倍。我们还发现相较ResNet50分类器有至多98倍加速且无精度损失,若牺牲部分精度则有280倍加速。

关键词

引用

@article{arxiv.1806.04226,
  title  = {Physical Representation-based Predicate Optimization for a Visual Analytics Database},
  author = {Michael R. Anderson and Michael Cafarella and German Ros and Thomas F. Wenisch},
  journal= {arXiv preprint arXiv:1806.04226},
  year   = {2019}
}

备注

Camera-ready version of the paper submitted to ICDE 2019, In Proceedings of the 35th IEEE International Conference on Data Engineering (ICDE 2019)