Big-Little Net:一种用于视觉与语音识别的高效多尺度特征表示
计算机视觉与模式识别
2019-08-01 v3
摘要
在本文中,我们提出一种新颖的卷积神经网络(CNN)架构,用于学习多尺度特征表示,并在速度与精度之间取得良好权衡。这是通过使用多分支网络实现的,该网络在不同分支具有不同计算复杂度。通过频繁合并来自不同尺度分支的特征,我们的模型在使用更少计算的同时获得多尺度特征。所提方法在物体识别与语音识别任务上,使用包括ResNet与ResNeXt在内的流行架构,展示了模型效率与性能的提升。对于物体识别,我们的方法在物体识别上减少33%计算量同时将精度提升0.9%。此外,我们的模型在精度与FLOPs缩减方面大幅超越最先进的CNN加速方法。在语音识别任务上,我们提出的多尺度CNNs节省30% FLOPs且词错误率略优,显示出跨领域的良好泛化能力。代码可在 https://github.com/IBM/BigLittleNet 获取。
引用
@article{arxiv.1807.03848,
title = {Big-Little Net: An Efficient Multi-Scale Feature Representation for Visual and Speech Recognition},
author = {Chun-Fu Chen and Quanfu Fan and Neil Mallinar and Tom Sercu and Rogerio Feris},
journal= {arXiv preprint arXiv:1807.03848},
year = {2019}
}
备注
git repo: https://github.com/IBM/BigLittleNet