CUDA-L1:基于对比强化学习提升 CUDA 优化
摘要
GPU 计算资源需求的指数增长制造了迫切需要自动化 CUDA 优化策略的压力。虽然近期 LLM 在代码生成方面显示出前景,但当前 SOTA 模型在提升 CUDA 速度方面成功率较低。本文引入 CUDA-L1,一个用于 CUDA 优化的自动强化学习框架,采用新颖的对比强化学习算法。CUDA-L1 在 CUDA 优化任务上实现了显著的性能提升:在 A100 上训练后,相对于 KernelBench 的默认基线,平均加速 x3.12,中位数加速 x1.42,覆盖所有 250 个 CUDA 内核,峰值加速可达 x120。除了 KernelBench 提供的默认基线外,CUDA-L1 相对于 Torch Compile 实现 x2.77 加速,相对于 Torch Compile 加 reduce overhead 实现 x2.88 加速,相对于 CUDA Graph 实现 x2.81 加速,相对于 cuDNN 库实现 x7.72 加速。此外,该模型还在不同 GPU 架构之间展示了可移植性。除这些基准结果外,CUDA-L1 还展示了若干特性:1) 发现了多种 CUDA 优化技术并学习了战略性地将其组合以实现最佳性能;2) 揭示了 CUDA 优化的基本原理,如优化的乘法性质;3) 揭示了非显而然的性能瓶颈并拒绝了实际上会损害性能的看似有益的优化。这些能力表明,RL 可仅通过基于加速的奖励信号,将最初表现不佳的 LLM 转化为有效的 CUDA 优化器,无需人类专家或领域知识。这种范式为自动优化 CUDA 操作开辟了可能性,具有显著促进 GPU 效率并缓解日益加剧的 GPU 计算资源压力的潜力。项目: deepreinforce-ai.github.io/cudal1_blog
引用
@article{arxiv.2507.14111,
title = {CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning},
author = {Xiaoya Li and Xiaofei Sun and Albert Wang and Jiwei Li and Chris Shum},
journal= {arXiv preprint arXiv:2507.14111},
year = {2026}
}
备注
Accepted by ICLR 2026