LS-CAT:大规模CUDA自动调优数据集
分布式、并行与集群计算
2021-03-29 v1 人工智能
摘要
机器学习(ML)方法的有效性取决于能否访问大型合适的数据集。在本文中,我们展示了如何构建源自GitHub的LS-CAT(大规模CUDA自动调优)数据集,用于训练基于NLP的ML模型。我们的数据集包含19 683个专注于线性代数的CUDA核函数。除了CUDA代码外,我们的LS-CAT数据集还包含5 028 536个相关的运行时间,涉及核函数、块大小和矩阵大小的不同组合。这些运行时间是在Nvidia GTX 980和Nvidia T4系统上进行的GPU基准测试。该信息为基于NLP的模型在源代码特征与线程块大小最优选择之间寻找关联奠定了基础。从我们的LS-CAT数据库中可以得出若干结果。例如,我们的实验结果表明,线程块大小的最优选择可为平均情况带来平均6%的提升。因此我们还分析了一般情况下可实现多少性能提升,发现10%的情况下通过使用最优块可获得超过20%的性能提升。本文还包括对当前和未来工作的描述。
引用
@article{arxiv.2103.14409,
title = {LS-CAT: A Large-Scale CUDA AutoTuning Dataset},
author = {Lars Bjertnes and Jacob O. Tørring and Anne C. Elster},
journal= {arXiv preprint arXiv:2103.14409},
year = {2021}
}