中文

基于 LLM 的集成测试故障自动诊断工具

软件工程 2026-04-15 v1 人工智能

摘要

集成测试对于复杂软件系统的质量和可靠性至关重要,但诊断其故障 presents significant challenges due to the massive volume, unstructured nature, and heterogeneity of logs they generate. 这些结果导致认知负荷大、信噪比低,使诊断困难且耗时。开发人员持续抱怨这些困难,并报告诊断集成测试故障所需时间显著超过诊断单元测试故障。为了解决这些不足之处,我们提出 Auto-Diagnose,一种新型诊断工具,利用 LLM 帮助开发人员高效确定集成测试故障的根本原因。Auto-Diagnose 分析故障日志,生成包含最相关日志行的简洁摘要,并集成到 Google 内部代码审查系统 Critique 中,提供上下文和即时帮助。基于我们的案例研究,Auto-Diagnose 效果显著。在针对 71 例真实故障进行的手动评估中,诊断根本原因的准确率达到了 90.14%。在其 Google 全球部署后,Auto-Diagnose 被用于 52,635 个不同故障测试。用户反馈显示,该工具仅在 5.8% 的情况下被认为“没有用”,且在 370 个在 Critique 中发布发现的工具中排名第 14 位。最后,用户访谈确认了 Auto-Diagnose 的有用性以及将自动诊断辅助工具集成到现有工作流程中的积极接受度。我们得出结论,由于 LLM 能够处理和总结复杂文本数据,LLM 在诊断集成测试故障方面取得了高度成功。将此类 AI 驱动工具自动集成到开发人员日常工作流程中被广泛接受,工具的准确率是影响开发人员感知和采纳的关键因素。

关键词

引用

@article{arxiv.2604.12108,
  title  = {LLM-Based Automated Diagnosis Of Integration Test Failures At Google},
  author = {Celal Ziftci and Ray Liu and Spencer Greene and Livio Dalloro},
  journal= {arXiv preprint arXiv:2604.12108},
  year   = {2026}
}