面向充分利用基于 NLP 的 OpenCL 内核设备映射优化
机器学习
2022-08-31 v1 分布式、并行与集群计算
摘要
如今,我们生活在极度设备异构的时代。尽管传统 CPU 架构高度多样,GPU 与 FPGA 等加速器设备也崭露头角,极大扩充了执行应用的可行方案池。然而,因硬件与软件间关系抽象,按应用需求选取合适设备是极具挑战的任务。需要精准的自动优化算法来应对当前软硬件的复杂性与多样性。最优执行历来依赖耗时的试错方法。过去十年间,机器学习(ML)与自然语言处理(NLP)随深度架构研究而蓬勃发展。在此背景下,将自然语言处理技术用于源代码以开展自动调优任务是一个新兴研究领域。本文扩展了 Cummins 等人名为 Deeptune 的工作,其解决了加速 OpenCL 内核的最优设备选择(CPU 或 GPU)问题。我们指出了 Deeptune 的三个主要局限,并据此提出四种不同的 DNN 模型,以提供更丰富的源代码上下文信息。实验结果表明,我们所提方法超越了 Cummins 等人的工作,预测精度最高提升 4%。
引用
@article{arxiv.2208.14124,
title = {Towards making the most of NLP-based device mapping optimization for OpenCL kernels},
author = {Petros Vavaroutsos and Ioannis Oroutzoglou and Dimosthenis Masouros and Dimitrios Soudris},
journal= {arXiv preprint arXiv:2208.14124},
year = {2022}
}
备注
Accepted at IEEE COINS 2022