PVANET:用于实时目标检测的深层轻量级神经网络
计算机视觉与模式识别
2016-10-03 v3
摘要
本文展示了如何通过适配和结合最新的技术创新,在多类别目标检测任务中实现最先进的精度,同时最小化计算成本。遵循“CNN 特征提取 + 区域提议 + RoI 分类”的通用流程,我们主要重新设计了特征提取部分,因为区域提议部分计算开销不大,而分类部分可以通过截断 SVD 等常用技术有效压缩。我们的设计原则是“更少的通道,更多的层数”,并采用了包括拼接 ReLU、Inception 和 HyperNet 在内的一些构建模块。所设计的网络深而窄,并借助批归一化、残差连接和基于平台检测的学习率调度进行训练。我们在著名的目标检测基准上取得了扎实的结果:VOC2007 上 mAP(平均精度均值)为 83.8%,VOC2012 上 mAP 为 82.5%(第二名),同时在 Intel i7-6700K CPU 单核上仅需 750ms/图像,在 NVIDIA Titan X GPU 上仅需 46ms/图像。理论上,与 VOC2012 的获胜者 ResNet-101 相比,我们的网络仅需其 12.3% 的计算成本。
引用
@article{arxiv.1608.08021,
title = {PVANET: Deep but Lightweight Neural Networks for Real-time Object Detection},
author = {Kye-Hyeon Kim and Sanghoon Hong and Byungseok Roh and Yeongjae Cheon and Minje Park},
journal= {arXiv preprint arXiv:1608.08021},
year = {2016}
}
备注
Full details about "PVANet 9.0" in the VOC2012 leaderboard (https://goo.gl/DuQBku). The test codes are available at https://github.com/sanghoon/pva-faster-rcnn