中文

检索增强代码生成中查询可回答性的评估

计算与语言 2024-11-26 v2

摘要

由于大型语言模型(LLM)前所未有的语言理解和生成能力,检索增强代码生成(RaCG)近年来被软件开发者广泛利用。虽然这提高了生产力,但仍频繁出现提供错误代码的情况。特别是,对于那些无法用给定的查询和API描述回答的用户查询,生成了看似合理但实际错误的代码。本研究提出了一项评估可回答性的任务,用于评估在RaCG中能否基于用户查询和检索到的API生成有效答案。此外,我们构建了一个名为检索增强代码生成可评估性(RaCGEval)的基准数据集,以评估执行此任务的模型性能。实验结果表明,该任务仍处于极具挑战性的水平,基线模型表现出46.7%的低性能。此外,本研究讨论了可能显著提高性能的方法。

关键词

引用

@article{arxiv.2411.05547,
  title  = {Assessing the Answerability of Queries in Retrieval-Augmented Code Generation},
  author = {Geonmin Kim and Jaeyeon Kim and Hancheol Park and Wooksu Shin and Tae-Ho Kim},
  journal= {arXiv preprint arXiv:2411.05547},
  year   = {2024}
}