使用深度序列模型的最优内核调优参数预测
机器学习
2024-04-18 v1 人工智能
摘要
GPU内核因其在高性能计算和机器学习等不同领域的实用性而成为计算的前沿。典型的GPU计算内核在典型应用中被调用数百万次甚至数十亿次,这使得其性能至关重要。由于优化表面的未知性,需要穷举搜索才能发现全局最优,但由于参数组合可能呈指数级增长,这是不可行的。在这项工作中,我们提出了一种使用深度序列到序列模型来预测控制计算内核的最优调优参数的方法。本文将内核参数的预测视为序列到序列的翻译问题,借鉴了自然语言处理(NLP)领域的模型。描述输入、输出和权重张量的参数被视为模型的输入语言,模型输出相应的内核参数。本质上,该模型将问题参数语言翻译为内核参数语言。本文的核心贡献是:a) 提出序列到序列模型可以准确学习GPU计算内核的性能动态;b) 一种新颖的网络架构,用于预测GPU内核的内核调优参数;c) 一种约束束搜索,结合了GPU硬件的物理限制以及其他专家知识,减少了搜索空间。所提出的算法在AMD机器学习原语库MIOpen中的各种卷积内核上可以达到超过90%的准确率。因此,所提出的技术可以减少开发时间和计算资源,以调整未见过的输入配置,从而缩短开发周期、降低开发成本并改善用户体验。
引用
@article{arxiv.2404.10162,
title = {Optimal Kernel Tuning Parameter Prediction using Deep Sequence Models},
author = {Khawir Mahmood and Jehandad Khan and Hammad Afzal},
journal= {arXiv preprint arXiv:2404.10162},
year = {2024}
}