中文

CUDAHercules:面向大语言模型的硬件感知专家级CUDA优化基准

机器学习 2026-05-12 v1

摘要

大型语言模型展现出用于自动CUDA编程的潜力,但即使是最强的编码模型(如Claude-Opus-4.6)在面向硬件感知的优化方面也可能远不及专家水平。我们引入CUDAHercules,一个评估生成CUDA代码是否达到端到端人类专家SOTA系统水平的基准测试。其覆盖范围包括单个kernel、模块级算子、完整应用程序以及跨Ampere、Hopper和Blackwell GPU的未解难题任务,任务通过领域特定语义验证器进行门控。评估Claude-Opus-4.6和GPT-5.4等模型显示, runnable CUDA与专家CUDA工程之间存在巨大差距:模型常在编译通过测试,却难以恢复匹配专家性能所需的优化策略。应用程序语义进一步降低成功率,迭代或工具增强反馈虽可提升正确性,但可能偏向缓慢的后备实现。这些结果表明,自动CUDA编程离完全解决仍远近,需加强硬件推理、提升工具使用能力,并发展将代码理解与硬件架构 grounding intelligence相连接的训练目标。

关键词

引用

@article{arxiv.2605.08467,
  title  = {CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs},
  author = {Shiyang Li and Zijian Zhang and Guangyan Sun and Yuebo Luo and Winson Chen and Yanzhi Wang and Mingyi Hong and Caiwen Ding},
  journal= {arXiv preprint arXiv:2605.08467},
  year   = {2026}
}