中文

CDMPP:一种设备–模型无关的张量程序延迟预测框架

机器学习 2023-11-20 v2 性能

摘要

深度神经网络 (DNNs) 在广泛的机器学习应用中展现出优异性能。获知在特定设备上运行 DNN 模型或张量程序的延迟,对 DNN 图级或张量级优化及设备选择等多种任务十分有用。考虑到 DNN 模型与设备的庞大空间阻碍对所有组合直接 profiling,近期工作聚焦于构建预测器以建模 DNN 模型在不同设备上的性能。然而,现有尝试均未能实现既可准确预测各类张量程序性能、又同时支持训练与推理加速器的代价模型。我们提出 CDMPP,一种面向跨模型与跨设备预测的高效张量程序延迟预测框架。我们设计了名为紧凑 AST 的、信息丰富且高效的张量程序表示,以及基于前序的位置编码方法,以捕捉张量程序内部结构。我们受域适应启发开发学习域不变表示的方法,并设计基于 KMeans 的采样算法,使预测器能从不同域(即不同 DNN 算子与设备)学习。我们在多样 DNN 模型与设备上的大量实验表明,CDMPP 以跨模型与跨设备预测分别 14.03% 与 10.85% 的预测误差、以及一个数量级更高的训练效率,显著优于最先进基线。实现与扩充数据集见 https://github.com/joapolarbear/cdmpp。

关键词

引用

@article{arxiv.2311.09690,
  title  = {CDMPP: A Device-Model Agnostic Framework for Latency Prediction of Tensor Programs},
  author = {Hanpeng Hu and Junwei Su and Juntao Zhao and Yanghua Peng and Yibo Zhu and Haibin Lin and Chuan Wu},
  journal= {arXiv preprint arXiv:2311.09690},
  year   = {2023}
}

备注

Accepted by EuroSys 2024