移动设备上深度可分离卷积与逐点卷积的高性能实现
分布式、并行与集群计算
2020-01-09 v1 性能
摘要
轻量级卷积神经网络(如MobileNets)专为直接在移动设备上进行推理而设计。在各种轻量级模型中,深度可分离卷积(DWConv)和逐点卷积(PWConv)是其关键操作。在本文中,我们观察到现有的DWConv和PWConv实现未能充分利用移动设备中的ARM处理器,并且在多核下表现出大量缓存缺失以及寄存器级别上较差的数据复用。我们提出了基于ARM架构重新优化DWConv和PWConv实现的技术。实验结果表明,相较于TVM(Chen等人2018),我们的实现在DWConv和PWConv上分别实现了高达5.5倍和2.1倍的加速。
引用
@article{arxiv.2001.02504,
title = {High Performance Depthwise and Pointwise Convolutions on Mobile Devices},
author = {Pengfei Zhang and Eric Lo and Baotong Lu},
journal= {arXiv preprint arXiv:2001.02504},
year = {2020}
}
备注
8 pages, Thirty-Four AAAI conference on Artificial Intelligence