面向 NFR 分类的基准数据集与 LLMs 比较——可解释 AI
软件工程
2025-10-22 v1
摘要
非功能需求 (NFR) 在决定软件系统整体质量和用户满意度方面发挥着关键作用。准确识别和分类 NFR 对于确保软件满足性能、可用性和可靠性期望至关重要。然而,手动从文档中识别 NFR 既耗时又容易出错,亟需自动化解决方案。在实施任何自动化解决方案之前,都需要一个稳健且全面的数据集。为构建此类数据集,我们从各种项目章程和开源软件文档中收集 NFR。此举增强了已有 NFR 数据集的技术深度和可用性。我们将 NFR 分类分为子类,并使用广泛使用的大型语言模型识别需求,以促进自动化。对 NFR 进行分类后,我们使用各种评估指标(包括精确率、召回率、F1 分数和lime得分)比较了所选 LLM 的分类结果:RoBERTa、CodeBERT、Gemma-2、Phi-3、Mistral-8B 和 Llama-3.1-8B。其中,Gemma-2 以 0.87 的精确率、0.89 的召回率和 0.88 的 F1 分数获得最佳结果,lime 命中率达 78/80。Phi-3紧随其后,以 0.85 的精确率、0.87 的召回率、0.86 的 F1 分数和最高的 lime 命中率 79/80。通过改进情境基础,此集成增强了模型对技术方面和用户需求的理解。
引用
@article{arxiv.2510.18096,
title = {A Benchmark Dataset And LLMs Comparison For NFR Classification With Explainable AI},
author = {Esrat Ebtida Sakib and MD Ahnaf Akib and Md Muktadir Mazumder and Maliha Noushin Raida and Md. Mohsinul Kabir},
journal= {arXiv preprint arXiv:2510.18096},
year = {2025}
}