中文

CUDA-L2:通过强化学习超越 cuBLAS 的矩阵乘法性能

机器学习 2025-12-15 v2 人工智能

摘要

本文提出了 CUDA-L2 系统,结合大语言模型(LLM)和强化学习(RL)用于自动优化半精度通用矩阵乘法(HGEMM)CUDA 内核。以 CUDA 执行速度作为 RL 奖励,CUDA-L2 在 1000 种配置下自动优化 HGEMM 内核。CUDA-L2 在离线模式下,平均超越 torch.matmul 提升 22.0%;针对 optimal layout 配置(normal-normal NN 和 transposed-normal TN),超越 cuBLAS 提升 19.2%;超越基于 cuBLASLt 启发式建议选择算法的 cuBLASLt-heuristic 提升 16.8%;以及超越从 cuBLASLt 建议中挑选最快算法的 cuBLASLt-AutoTuning 模型提升 11.4%。在服务器模式下,内核以随机间隔执行模拟真实推理场景,加速比进一步提升至对 torch.matmul、cuBLAS、cuBLASLt-heuristic 和 cuBLASLt-AutoTuning 分别提升 28.7%、26.0%、22.4% 和 15.9%。CUDA-L2 表明,即使是最性能关键、经过高度优化的内核如 HGEMM,也可以通过 LLM 引导的 RL 自动化方式,通过系统性地探索不切实际由人类完成的配置空间,从而实现性能提升。项目和代码可在 github.com/deepreinforce-ai/CUDA-L2 查找。

关键词

引用

@article{arxiv.2512.02551,
  title  = {CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning},
  author = {Songqiao Su and Xiaofei Sun and Xiaoya Li and Albert Wang and Jiwei Li and Chris Shum},
  journal= {arXiv preprint arXiv:2512.02551},
  year   = {2025}
}

备注

Project code: github.com/deepreinforce-ai/CUDA-L2