中文

ParEval-Repo:用于评估LLM在仓库级HPC翻译任务上的基准测试套件

分布式、并行与集群计算 2025-09-08 v2

摘要

近年来,GPGPU架构变得日益多样化,这促使各种专用编程模型和软件栈的出现以提供支持。可移植编程模型虽然存在,但将其移植并优化以适应不同硬件架构需要开发人员付出大量精力。大语言模型(LLM)可能有助于减轻程序员的这一负担。在本文中,我们提出了一种新颖的基准测试与测试框架ParEval-Repo,可用于评估基于LLM的方法在跨GPGPU执行模型自动翻译整个代码库方面的有效性。ParEval-Repo包含若干科学计算和AI微型应用程序,涵盖多种编程模型和不同级别的仓库复杂度。我们使用ParEval-Repo评估了一系列最先进的开源和商业LLM,分别采用非智能体方法和自上而下的智能体方法。我们从可编译性、功能正确性、构建错误类别以及以推理token数量衡量的翻译成本等方面,对LLM及各方法生成的代码进行了评估。结果表明,LLM翻译科学应用程序对于小型程序是可行的,但在生成功能性构建系统和跨文件依赖关系方面存在的困难,对扩展到更大规模的代码库构成了挑战。

关键词

引用

@article{arxiv.2506.20938,
  title  = {ParEval-Repo: A Benchmark Suite for Evaluating LLMs with Repository-level HPC Translation Tasks},
  author = {Joshua H. Davis and Daniel Nichols and Ishan Khillan and Abhinav Bhatele},
  journal= {arXiv preprint arXiv:2506.20938},
  year   = {2025}
}

备注

10 pages, 5 figures