基于在线反馈的用户需求自动分类 -- 复制研究
摘要
然然语言处理 (NLP) 技术已在需求工程 (RE) 领域广泛应用于支持分类和歧义检测等任务。尽管 RE 研究根植于实证调查,但对复制 NLP4RE 研究的注意力有限。快速发展的 NLP 领域为高效的机器辅助工作流程提供了新机会,这些工作流程将为前沿带来新的视角和结果。因此,我们复制并扩展了之前的 NLP4RE 研究(基线)——"在小数据集环境下使用深度学习对用户需求进行分类",该研究评估了用于从用户评论中进行需求分类的不同深度学习模型。我们使用公开发布的源代码复现了原始结果,从而有助于加强基线研究的外部有效性。随后,我们通过在外部数据集上评估模型性能并与 GPT-4o 零样本分类器进行比较来扩展了实验 setup。我们准备了基线研究的复制研究 ID 卡,这对于评估复制准备性至关重要。结果显示,不同模型之间的可重复性水平各不相同,其中朴素贝叶斯实现了完美的可重复性。相比之下,BERT 和其他模型表现出混合结果。我们的发现表明,基线深度学习模型(BERT 和 ELMo)在外部数据集上表现出良好的泛化能力,GPT-4o 的性能相当于传统基线机器学习模型。此外,我们的评估确认了基线研究的复制准备性;然而,缺失的环境设置文件会进一步提高准备就绪水平。我们包含了这些缺失信息并提供了本研究的复制研究 ID 卡,以进一步鼓励和支持对本研究的复制。
引用
@article{arxiv.2507.21532,
title = {Automatic Classification of User Requirements from Online Feedback -- A Replication Study},
author = {Meet Bhatt and Nic Boilard and Muhammad Rehan Chaudhary and Cole Thompson and Jacob Idoko and Aakash Sorathiya and Gouri Ginde},
journal= {arXiv preprint arXiv:2507.21532},
year = {2025}
}
备注
10 pages, 3 figures, Replication package available at https://zenodo.org/records/15626782, Accepted at AIRE 2025 (12th International Workshop on Artificial Intelligence and Requirements Engineering)