中文

在未见应用、数据集与元数据上评估软件用户反馈分类器

软件工程 2021-12-28 v1

摘要

倾听用户需求对于构建和维护高质量软件至关重要。在线软件用户反馈已被证明包含大量对需求工程(RE)有用的信息。先前的研究已创建机器学习分类器来解析这些反馈以获取开发洞察。尽管这些分类器在测试集上评估时报告了总体良好的性能,但关于它们在不同形式的未见数据上泛化能力的问题仍然存在。本研究评估了机器学习分类器在两项常见分类任务(分类错误报告与功能请求)反馈上的性能。利用来自先前研究工作的七个数据集,我们考察了当在来自不同于训练集中所含应用反馈上评估时,以及当在完全不同数据集(来自不同反馈平台和/或不同研究者标注)上评估时分类器的性能。我们还度量了使用平台特定元数据作为分类特征时性能的差异。我们证明,在多数被测案例中,未见应用反馈上的分类性能与已见应用反馈相似。然而,分类器在未见数据集上表现不佳。我们展示了多数据集训练或零样本分类方法可在一定程度上缓解此性能下降。最后,我们发现使用元数据作为特征对错误报告与功能请求分类在多数被测数据集中未带来统计显著的改进。我们讨论了这些结果对开发用户反馈分类模型以分析和提取软件需求的影响。

关键词

引用

@article{arxiv.2112.13497,
  title  = {Evaluating Software User Feedback Classifiers on Unseen Apps, Datasets, and Metadata},
  author = {Peter Devine and Yun Sing Koh and Kelly Blincoe},
  journal= {arXiv preprint arXiv:2112.13497},
  year   = {2021}
}