FastKernels: 生产环境 GPU 核函数生成基准测试
机器学习
2026-05-25 v1 人工智能
计算与语言
摘要
基于 LLM 的 GPU 核函数生成代理正在快速进步,但其进展 fundamentally 受限于其优化的基准测试。现有基准测试与生产推理框架不良对齐:它们在单个 GPU 上以人造输入评估核函数,忽略周围的编译堆栈,并奖励复制已知优化而非发现新优化。结果产生的奖励信号是误导性的:代理学习生成在沙箱中得分良好的核函数,但在集成到真实系统时引入接口不兼容、编译堆栈冲突和隐藏的正确性退化。我们引入 FastKernels,一个围绕 46 个代表性架构(跨 8 个类别)构建的核函数基准,其核函数整体覆盖了 96.2%(409/425)的 HuggingFace Transformers 架构。FastKernels 同时作为一个以最小化方式构建的、生产级推理框架,在主流 LLM 推理服务方面与硬化系统如 vLLM 和 SGLang 保持一致,且在未得到充分服务的架构上显著超过上游参考;每个任务的接口镜像其架构族的先进库中的对应模块,使优化核函数能够直接部署到生产代码库中。评估最先进的核函数代理在 FastKernels 上,我们发现即使是最强的代理也仅实现 0.94 相对于生产基准的聚合加速,较弱的代理为 和 --确认基准-生产错位是该领域的关键瓶颈。我们将 FastKernels 公开发布,作为通往核函数代理其基准收益直接转化为生产吞吐量改进的一步。代码地址: https://github.com/Snowflake-AI-Research/fastkernels
引用
@article{arxiv.2605.23215,
title = {FastKernels: Benchmarking GPU Kernel Generation in Production},
author = {Gabriele Oliaro and Yichao Fu and May Jiang and Owen Lu and Junli Wang and Zhihao Jia and Hao Zhang and Samyam Rajbhandari},
journal= {arXiv preprint arXiv:2605.23215},
year = {2026}
}