oneDNN 图编译器:一种用于高性能深度学习编译的混合方法
机器学习
2024-03-12 v3 性能
摘要
随着深度学习模型的快速发展以及硬件对稠密计算的支持,深度学习工作负载特征已从计算密集型操作上的少数热点显著转变为散布于模型中的广泛操作。利用专家调优的原语实现来加速少数计算密集型操作并不能充分挖掘 AI 硬件的性能潜力。已有多种努力致力于编译完整的深度神经网络(DNN)图。其中最大的挑战之一是通过为稠密计算密集型操作生成专家级性能代码,并在跨多个计算密集型操作的 DNN 计算图范围内应用编译优化,从而实现高性能张量编译。我们提出 oneDNN 图编译器,一种采用混合方法的张量编译器,结合编译器优化与专家调优核的技术,以对深度神经网络图进行高性能代码生成。oneDNN 图编译器解决了深度学习领域特有的优化挑战,如低精度计算、图操作的激进融合、静态张量形状与内存布局优化、常量权重优化以及内存缓冲区重用。实验结果表明,在 Intel Xeon Scalable Processors 上,相对于现有张量编译器和原语库,该方法对性能关键的 DNN 计算图和端到端模型取得了显著的性能提升。
引用
@article{arxiv.2301.01333,
title = {oneDNN Graph Compiler: A Hybrid Approach for High-Performance Deep Learning Compilation},
author = {Jianhui Li and Zhennan Qin and Yijie Mei and Jingze Cui and Yunfei Song and Ciyong Chen and Yifei Zhang and Longsheng Du and Xianhang Cheng and Baihui Jin and Yan Zhang and Jason Ye and Eric Lin and Dan Lavery},
journal= {arXiv preprint arXiv:2301.01333},
year = {2024}
}
备注
10 pages excluding reference, 9 figures, 1 table