高性能零内存开销直接卷积
机器学习
2018-09-28 v1 分布式、并行与集群计算
机器学习
摘要
深度神经网络中卷积层的计算通常依赖于通过占用额外内存(用于打包目的或作为算法所需)以空间换时间的高性能例程来提升性能。这种方法的问题有两方面。首先,这些例程带来额外的内存开销,降低了可容纳于内存容量有限的嵌入式设备上的网络整体规模。其次,这些高性能例程并非为执行卷积而优化,这意味着所获得的性能通常低于常规预期。在本文中,我们证明直接卷积在正确实现时,可消除所有内存开销,并在常规与嵌入式 CPU 架构上取得比现有卷积层高性能实现好 10% 到 400% 倍的性能。我们还表明,高性能直接卷积展现出更好的扩展性能,即在线程数增加时性能下降更少。
引用
@article{arxiv.1809.10170,
title = {High Performance Zero-Memory Overhead Direct Convolutions},
author = {Jiyuan Zhang and Franz Franchetti and Tze Meng Low},
journal= {arXiv preprint arXiv:1809.10170},
year = {2018}
}
备注
the 35th International Conference on Machine Learning(ICML 2018), camera ready