FAIL:使用大型语言模型从新闻中分析软件故障
软件工程
2024-09-19 v2
摘要
软件故障为工程工作、标准、法规提供信息。例如,Log4J漏洞使政府和行业关注对软件供应链的评估和安全。获取私人工程记录困难,因此故障分析倾向于使用新闻媒体报道的信息。然而,此方向的先前工作依赖于手动分析,限制了其分析规模。社区缺乏自动化支持,以便此类分析能够考虑广泛的新闻来源和事件。在本文中,我们提出了使用大型语言模型的故障分析调查(FAIL)系统来填补这一空白。FAIL收集、分析和总结新闻中报道的软件故障。FAIL对描述同一事件的文章进行分组,然后根据现有的后期报告、故障和系统特征分类框架进行分析。为微调和评估FAIL,我们遵循了先前工作的方法,对31个软件故障进行了手动分析。FAIL在收集关于软件故障的新闻方面达到了90%的F1分数,对报道同一事件的文章合并达到了0.98的V-measure,并提取了90%的故障事实。随后,我们将FAIL应用于2010年至2022年间来自11个提供商的总计137,427篇新闻文章。FAIL识别并分析了4,184篇文章中报道的2,457个独立故障。我们的发现包括:(1)当前大型语言模型能够识别描述故障的新闻文章,并根据结构化分类框架进行分析;(2)组织内外类似故障的高频发生;(3)软件故障后果的严重程度在过去十年中有所增加。FAIL数据库已完全公开,供研究人员、工程师和政策制定者从多样化的软件故障中学习。
引用
@article{arxiv.2406.08221,
title = {FAIL: Analyzing Software Failures from the News Using LLMs},
author = {Dharun Anandayuvaraj and Matthew Campbell and Arav Tewari and James C. Davis},
journal= {arXiv preprint arXiv:2406.08221},
year = {2024}
}
备注
Accapted at the 9th IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)