中文

LLM 生成的错误报告摘要中的幻觉现象:经验分析与检测

软件工程 2026-05-26 v1 人工智能

摘要

大型语言模型 (LLM) 越来越多地用于生成软件错误报告的摘要,包括诊断步骤 (Steps-to-Reproduce, S2R)、实际行为 (Actual Behavior, AB) 和预期行为 (Expected Behavior, EB) 等章节。然而,这些模型经常会生成令人信服但缺乏来源报告支撑的幻觉内容。这可能误导开发者并降低对自动化维护工具信任的水平。现有的幻觉检测方法通常在完整响应层面进行评估,不考虑技术文档的结构。初步的探索性研究对 80 份结构化错误报告摘要进行分析后发现,约有 47.9% 包含缺失信息,而 12.3% 包含虚构内容,凸显了在错误报告摘要中进行系统性幻觉分析的必要性。本文从章节感知角度,对 LLM 生成的错误报告摘要中的幻觉现象进行经验性研究。我们使用源自 Mozilla 开源项目的 BugsRepo 数据集,引入受控的人工合成幻觉注入,以构建用于训练和评估的基准数据集。我们提出一种章节感知的幻觉检测方法,该方法联合预测摘要是否包含幻觉内容、识别受影响章节以及分类幻觉类型。实验结果表明,所提方法在多个预训练语言模型上均表现出色,最佳模型在报告级 Macro-F1 为 0.89,章节级 Macro-F1 为 0.83,幻觉类型 Macro-F1 为 0.84。我们进一步分析了常见的幻觉模式和模型失败模式,以更好地理解当前 LLM 生成的错误报告摘要的局限性。研究结果凸显了在软件维护工作流程中进行章节感知幻觉分析的重要性,以提高 LLM 辅助错误报告摘要可靠性。

关键词

引用

@article{arxiv.2605.24137,
  title  = {Empirical Analysis and Detection of Hallucinations in LLM-Generated Bug Report Summaries},
  author = {Hinduja Nirujan and Shreyas Patil and Abdallah Ayoub and Ahmad Abdel Latif and Gouri Ginde},
  journal= {arXiv preprint arXiv:2605.24137},
  year   = {2026}
}