中文

从程序片段到因果清晰:通过上下文分区评估可信、可操作的 LLM 生成的故障解释

软件工程 2026-05-21 v2

摘要

基于大语言模型(LLM)的调试系统可以生成故障解释,但这些解释可能不完整或不正确。误导性的解释对下游任务(如缺陷分流、缺陷修复)造成不良影响。我们研究解释质量受各种 LLM 上下文配置的影响。现有工作主要将 LLM 生成的故障解释视为调试或修复工作流程中的附带产物,对 undifferentiated artifacts(如代码、测试和错误消息)进行通用提示,而非将解释作为具有专门质量评估的第一类输出。因此,现有方法limited support for assessing whether these explanations capture the underlying fault-error-failure mechanism and for actionable next steps, most techniques prioritize task success(如补丁正确性或审阅质量)而非对明确因果解释质量的评估。我们系统性地变更调试信息,研究不同的上下文组成如何影响 LLM 生成的故障解释质量。在 93 套上下文配置上使用真实缺陷和三种经济可行模型(gpt-5-mini、DeepSeek-V3.2 和 Grok-4.1-fast)进行测试,我们用六个准则评估解释,并在用户研究中验证 LLM-as-a-judge 评分与人类评分的一致性。我们的结果表明,解释质量受因果影响。充满证据、针对性强的 artifact 可提升因果和行动导向的质量,而过大的上下文则倾向于产生模糊解释。高分 quartiles 与更高的后续修复通过率相关,对于某些模型,还与接近参考最小修复的修复版本有关。相比之下,低分 quartiles 甚至可能低于无解释基准。复现软件包已公开。

关键词

引用

@article{arxiv.2604.18309,
  title  = {From Program Slices to Causal Clarity: Evaluating Faithful, Actionable LLM-Generated Failure Explanations via Context Partitioning and LLM-as-a-Judge},
  author = {Julius Porbeck and Christian Medeiros Adriano and Holger Giese},
  journal= {arXiv preprint arXiv:2604.18309},
  year   = {2026}
}

备注

10 pages, 5 figures, 5 tables. Accepted to EASE 2026 (EQUISA workshop), Glasgow, United Kingdom