生成式语言模型在需求工程应用中的潜力:洞察当前优势与局限
软件工程
2024-12-03 v1 人工智能
摘要
传统语言模型在软件工程领域已被广泛评估,但 ChatGPT 和 Gemini 的潜力尚未得到充分探索。为填补这一空白,本文提出全面的案例研究,探讨两种语言模型用于开发多样化需求工程应用的潜力。深入探讨不同层次专家知识提示对两种语言模型预测准确性的影响。在 4 个公共需求工程任务基准数据集上,对比两种语言模型与现有任务特定机器/深度学习预测器和传统语言模型的性能。具体而言,本文利用 4 个基准数据集:Pure(7,445 样本,需求提取)、PROMISE(622 样本,需求分类)、REQuestA(300 对问答对)和航空数据集(6,347 字,需求命名实体识别)。我们的实验表明,与 ChatGPT 相比,Gemini 需要更精心的提示工程才能提供准确的预测。此外,在需求提取基准数据集上,最新的 F1 分数为 0.86,而 ChatGPT 和 Gemini 分别达到 0.76 和 0.77。在需求分类数据集上,最新的 F1 分数为 0.96,两种语言模型分别为 0.78。在命名实体识别任务中,最新的 F1 分数为 0.92,ChatGPT 仅能达到 0.36,Gemini 为 0.25。同样,在问答数据集上,最新的 F1 分数为 0.90,ChatGPT 和 Gemini 分别达到 0.91 和 0.88。我们的实验表明,Gemini 需要比 ChatGPT 更精确的提示工程。除问答任务外,两种模型在其他任务上均不及当前最新的预测器。
引用
@article{arxiv.2412.00959,
title = {Generative Language Models Potential for Requirement Engineering Applications: Insights into Current Strengths and Limitations},
author = {Summra Saleem and Muhammad Nabeel Asim and Ludger Van Elst and Andreas Dengel},
journal= {arXiv preprint arXiv:2412.00959},
year = {2024}
}