ARMv8 多核 CPU 上面向 NUMA 的基于 FFT 的卷积
分布式、并行与集群计算
2021-09-28 v1
摘要
卷积神经网络(CNNs)作为深度学习最具代表性的算法之一,被广泛应用于各类人工智能应用中。卷积操作常占据 CNN 的大部分计算开销。基于 FFT 的算法可通过降低算法复杂度来提升卷积效率,已有大量关于多核 CPU 上基于 FFT 卷积高性能实现的工作。然而,针对多核 CPU 中非一致内存访问(NUMA)特性的优化尚属空白。本文提出了一种在具有 NUMA 架构的 ARMv8 多核 CPU 上面向 NUMA 的基于 FFT 卷积实现。该实现通过 FFT 变换的数据重排与复矩阵乘法的三级并行化,减少了大量远程内存访问。在具有 NUMA 架构的 ARMv8 多核 CPU 上的实验结果表明,我们的面向 NUMA 实现在大多数情况下性能远优于最先进的工作。
引用
@article{arxiv.2109.12259,
title = {NUMA-aware FFT-based Convolution on ARMv8 Many-core CPUs},
author = {Xiandong Huang and Qinglin Wang and Shuyu Lu and Ruochen Hao and Songzhu Mei and Jie Liu},
journal= {arXiv preprint arXiv:2109.12259},
year = {2021}
}
备注
Accepted by the 19th IEEE International Symposium on Parallel and Distributed Processing with Applications (IEEE ISPA 2021)