利用语言模型增强自然语言需求的完整性
软件工程
2023-02-10 v1
摘要
[背景与动机] 自然语言需求中的不完整性是一个具有挑战性的问题。[问题] 检测需求中不完整性的一种常见技术是将需求与外部来源进行核对。随着 BERT 等语言模型的出现,一个有趣的问题是语言模型是否可作为发现需求中潜在不完整性的有用外部来源。[核心思想/结果] 我们对需求中的词进行掩码,并利用 BERT 的掩码语言模型(MLM)生成用于填充掩码位置的上下文预测。我们通过从需求中保留内容来模拟不完整性,并衡量 BERT 预测存在于被保留内容中但未向 BERT 披露内容中出现的术语的能力。[贡献] BERT 可配置为每个掩码生成多个预测。我们的第一个贡献是确定每个掩码多少预测是在有效发现需求遗漏与预测噪声水平之间的最优权衡。我们的第二个贡献是设计一种基于机器学习的过滤器,对 BERT 做出的预测进行后处理以进一步降低噪声。我们在取自 PURE 数据集 [1] 的 40 份需求规约上对我们的方案进行了实证评估。我们的结果表明:(1) BERT 做出的预测在精准定位需求中缺失术语方面高度有效;(2) 我们的过滤器可大幅降低预测中的噪声,从而使 BERT 成为改进需求完整性的更具吸引力的辅助工具。
引用
@article{arxiv.2302.04792,
title = {Using Language Models for Enhancing the Completeness of Natural-language Requirements},
author = {Dipeeka Luitel and Shabnam Hassani and Mehrdad Sabetzadeh},
journal= {arXiv preprint arXiv:2302.04792},
year = {2023}
}
备注
This paper has been accepted at the 29th International Working Conference on Requirement Engineering: Foundation for Software Quality (REFSQ 2023)