中文

PERC:面向代表性不足代码生成的计划即查询示例检索

软件工程 2024-12-23 v2 人工智能 计算与语言

摘要

使用大语言模型进行代码生成已展现出巨大的潜力,尤其是采用带有少样本示例的检索增强生成(RAG)时。然而,选择能够提升生成质量的有效示例仍是一项具有挑战性的任务,特别是当目标编程语言(PL)代表性不足时。在本研究中,我们提出了两个关键发现:(1)检索其呈现的算法计划可被参考以生成所需行为的示例,能显著提高生成准确率;(2)将代码转换为伪代码能有效捕获此类算法计划,即使在源编程语言和目标编程语言不同的情况下也能提升检索质量。基于这些发现,我们提出了用于代码生成少样本提示的计划即查询示例检索(Plan-as-query Example Retrieval for few-shot prompting in Code generation, PERC),这是一种利用算法计划来识别和检索有效示例的新颖框架。我们通过在 CodeContests、HumanEval 和 MultiPL-E 基准上的大量实验验证了 PERC 的有效性:无论源编程语言和目标编程语言是否相同,PERC 在代码生成上均持续优于当前最先进的 RAG 方法,突显了其在多样化编码环境中的适应性和鲁棒性。

关键词

引用

@article{arxiv.2412.12447,
  title  = {PERC: Plan-As-Query Example Retrieval for Underrepresented Code Generation},
  author = {Jaeseok Yoo and Hojae Han and Youngwon Lee and Jaejin Kim and Seung-won Hwang},
  journal= {arXiv preprint arXiv:2412.12447},
  year   = {2024}
}

备注

Accepted by COLING 2025 main conference