PennySynth:基于 RAG 的量子代码数据合成生成框架
计算与语言
2026-05-26 v1 人工智能
摘要
量子编程框架的日益复杂化暴露了现有大型语言模型(LLM)基于代码助手的关键局限性:通用模型在面对特定量子编码挑战时会幻觉 PennyLane-specific 门名称,错误放置设备配置,并生成结构无效的电路。我们提出 PennySynth,一个检索增强生成框架,通过构建包含 13,389 对 PennyLane 指令-代码配对的精选知识库来弥补这一差距,该知识库通过对官方 PennyLane 代码库、社区 GitHub 来源和 QHack 竞赛档案进行三阶段抽取、验证和去重管道构建。PennySynth 引入了使用 st-codesearch-distilroberta-base 进行代码感知嵌入策略,该模型专为自然语言到代码检索而训练,使平均检索余弦相似度从 0.45 提升至 0.726。我们在跨越三年 QHack 竞赛(2022、2023、2024)共 74 个挑战的评估中,PennySynth 在 QHack 2022、2023、2024 上的 pass@5 分别达到 64%、68% 和 52%,相较于无检索的 Claude Sonnet 提升了 28、25 和 28 个百分点。我们进一步引入量子适应的 CodeBLEU 指标,对 qml.* 标记模式进行加权,表明结构代码相似性和功能正确性分别捕捉量子代码质量的不同方面。受控消融实验揭示,代码感知嵌入是检索性能的主要驱动力,而数据集扩充和来源组成在检索质量足够精确时提供额外收益。
引用
@article{arxiv.2605.25572,
title = {PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation},
author = {Minghao Shao and Nouhaila Innan and Hariharan Janardhanan and Muhammad Kashif and Alberto Marchisio and Muhammad Shafique},
journal= {arXiv preprint arXiv:2605.25572},
year = {2026}
}
备注
11 pages, 3 figures