中文

ViP:用于加速基于 CNN 的图像分类与目标检测的虚拟池化

计算机视觉与模式识别 2020-02-21 v2

摘要

近年来,卷积神经网络(CNN)在视觉学习任务中展现出优越能力。尽管在精度方面 CNN 提供了前所未有的性能,但它们在现代计算机系统中也被认为是计算密集且能耗高的。本文中,我们提出虚拟池化(ViP),一种模型级方法,可在具有可证明误差界的前提下,改善基于 CNN 的图像分类与目标检测任务的速度与能耗。我们通过四个 CNN 模型、三个代表性数据集、桌面与移动平台以及两项视觉学习任务(即图像分类与目标检测)上的实验展示了 ViP 的功效。例如,ViP 在 VGG-16 的 ImageNet 分类上以低于 1.5% 的精度下降实现了 2.1 倍加速,并在 Faster-RCNN 的 PASCAL VOC 目标检测上以 0.025 mAP 下降实现了 1.8 倍加速。ViP 还使移动 GPU 与 CPU 能耗分别降低至多 55% 与 70%。作为对现有加速方法的补充,ViP 在 ThiNet 上实现 1.9 倍加速,从而在 VGG-16 上带来 5.23 倍的综合加速。此外,ViP 为机器学习从业者提供了一个调节旋钮,以生成一组在系统速度/能耗与精度之间具有不同权衡的 CNN 模型,从而更好地满足其任务需求。代码见 https://github.com/cmu-enyac/VirtualPooling。

关键词

引用

@article{arxiv.1906.07912,
  title  = {ViP: Virtual Pooling for Accelerating CNN-based Image Classification and Object Detection},
  author = {Zhuo Chen and Jiyuan Zhang and Ruizhou Ding and Diana Marculescu},
  journal= {arXiv preprint arXiv:1906.07912},
  year   = {2020}
}

备注

8 pages