中文

ALT:通过打破图级与算子级优化间的壁垒提升深度学习性能

机器学习 2022-11-01 v4 分布式、并行与集群计算

摘要

深度学习模型依赖高度优化的张量库以在异构硬件上实现高效推理。当前的深度编译器通常预先确定张量布局,随后优化算子的循环。然而,这种单向且一次性的工作流将图级优化与算子级优化严格分隔于不同系统层,错失了统一调优的机会。本文提出ALT,一种对深度模型执行图级与算子级联合优化的编译器。ALT提供通用变换模块,借助易用的原语函数操控布局与循环。ALT进一步集成自动调优模块,在保证效率的同时联合优化图级数据布局与算子级循环。实验结果表明,ALT在单算子性能(如平均1.5倍加速)与端到端推理性能(如平均1.4倍加速)上均显著优于最先进的编译器(如Ansor)。

关键词

引用

@article{arxiv.2210.12415,
  title  = {ALT: Boosting Deep Learning Performance by Breaking the Wall between Graph and Operator Level Optimizations},
  author = {Zhiying Xu and Jiafan Xu and Hongding Peng and Wei Wang and Xiaoliang Wang and Haoran Wan and Haipeng Dai and Yixu Xu and Hao Cheng and Kun Wang and Guihai Chen},
  journal= {arXiv preprint arXiv:2210.12415},
  year   = {2022}
}