中文

代码变更到自然语言生成中的幻觉:普遍性与检测指标评估

软件工程 2025-08-13 v1 人工智能

摘要

语言模型在软件工程领域的广泛任务中(如代码生成)展现出强大的能力,但它们存在幻觉问题。虽然幻觉已在自然语言和代码生成中分别被研究,但在涉及代码变更(其代码格式结构复杂且依赖上下文)的任务中,幻觉的发生情况在很大程度上仍未得到探索。本文首次全面分析了涉及代码变更到自然语言生成的两个关键任务中的幻觉:提交消息生成和代码审查评论生成。我们量化了近期语言模型中幻觉的普遍性,并探索了一系列基于指标的自动检测方法。我们的发现表明,大约50%的生成代码审查和20%的生成提交消息包含幻觉。虽然常用指标单独作为检测器效果较弱,但结合多个指标可以显著提高性能。值得注意的是,模型置信度和特征归因指标对幻觉检测有显著贡献,显示出在推理时进行检测的潜力。\footnote{所有代码和数据将在接收后发布。}

关键词

引用

@article{arxiv.2508.08661,
  title  = {Hallucinations in Code Change to Natural Language Generation: Prevalence and Evaluation of Detection Metrics},
  author = {Chunhua Liu and Hong Yi Lin and Patanamon Thongtanunam},
  journal= {arXiv preprint arXiv:2508.08661},
  year   = {2025}
}

备注

8 main pages, 5 figures