KernelBench:LLM 能否编写高效 GPU 内核?
计算机科学与博弈论
2025-02-19 v2
摘要
高效 GPU 内核对构建高性能机器学习架构至关重要,但编写它们是一项耗时的挑战,需要相当大的专业知识;因此,我们探索使用语言模型(LM)来自动生成内核。我们引入 KernelBench,一个用于评估 LM 编写快速且正确内核能力的开源框架,涵盖 250 个精心挑选的 PyTorch ML 工作负载。KernelBench 代表了一个真实的工程环境,解决本基准直接转化为更快的实用内核。我们引入了新的评估指标 fast_p,其衡量生成内核在功能正确性和相对于基准速度提升超过可调阈值 p 的百分比。我们的实验在 various state-of-the-art models and test-time methods across 显示,前沿推理模型开箱即用表现最佳,但总体仍不够理想,匹配 PyTorch 基准的案例不到 20%。尽管我们展示了结果可以通过利用执行和剖析反馈在迭代细化过程中获得改进,KernelBench 仍是一个具有挑战性的基准,随着我们提高速度阈值 p 的难度不断增加。
引用
@article{arxiv.2502.10516,
title = {A new lower bound for multi-color discrepancy with applications to fair division},
author = {Ioannis Caragiannis and Kasper Green Larsen and Sudarshan Shyam},
journal= {arXiv preprint arXiv:2502.10516},
year = {2025}
}