QHackBench:基于PennyLane黑客挑战对大语言模型量子代码生成进行基准测试
人工智能
2025-09-01 v2 编程语言
软件工程
摘要
最近的大语言模型(LLM)进展显示出在代码生成方面的强大潜力,但其在量子计算领域的有效性仍未得到充分探索。本文对LLM进行基准测试,以评估其在PennyLane量子代码生成方面的性能,基于来自量子黑客挑战(QHack)的真实世界挑战。我们引入QHackBench——一个源自QHack比赛的新型基准数据集,并在vanilla提示和检索增强生成(RAG)下评估模型性能。我们的结构化评估框架在不同难度级别下评估功能正确性、语法有效性和执行成功率。结果表明,RAG增强模型辅以扩充的PennyLane数据集,大约产生与标准提示相当的结果,尤其在复杂量子算法方面。此外,我们引入一个多智能体评估管道,通过迭代细化错误解决方案进一步提升执行成功率。为促进进一步的研究,我们承诺公开发布QHackBench,以及我们的评估框架和实验结果,以推动AI辅助量子编程的持续进步。
引用
@article{arxiv.2506.20008,
title = {QHackBench: Benchmarking Large Language Models for Quantum Code Generation Using PennyLane Hackathon Challenges},
author = {Abdul Basit and Minghao Shao and Muhammad Haider Asif and Nouhaila Innan and Muhammad Kashif and Alberto Marchisio and Muhammad Shafique},
journal= {arXiv preprint arXiv:2506.20008},
year = {2025}
}
备注
To appear at the IEEE International Conference on Quantum Artificial Intelligence (QAI), Naples, Italy, November 2025