中文

基于语言分析、众包和大语言模型的在线用户反馈质量特征分类

软件工程 2025-06-16 v1

摘要

可用性或可靠性等软件质量是移动应用用户满意度的最强决定因素之一,构成了软件产品在线用户反馈的重要组成部分,使其成为指导开发过程的质量相关反馈的宝贵来源。海量的在线用户反馈要求自动识别质量特征,但在线用户反馈的异构性以及适当训练语料的缺乏限制了监督机器学习的应用。因此,我们研究了三种在低数据设置下可能有效的途径:基于质量相关关键词的语言模式(LPs)、众包微任务指令以及大语言模型(LLM)提示。我们确定了每种途径的可行性,然后比较了它们的准确性。对于质量特征的复杂多类分类,基于 LPs 的方法根据质量特征的不同取得了不同的精确率(0.38–0.92),且召回率较低;众包在两个连续阶段取得了最佳平均准确率(0.63、0.72),这与表现最佳的 LLM 条件(0.66)和基于 LLM 多数投票的预测(0.68)相当。我们的结果表明,在这种低数据设置下,使用众包或 LLM 而非依赖专家的两种方法能够实现准确的分类,而基于 LPs 的方法仅有有限的潜力。众包和 LLM 在此领域的潜力甚至可能延伸至构建训练语料。

关键词

引用

@article{arxiv.2506.11722,
  title  = {Classification of Quality Characteristics in Online User Feedback using Linguistic Analysis, Crowdsourcing and LLMs},
  author = {Eduard C. Groen and Fabiano Dalpiaz and Martijn van Vliet and Boris Winter and Joerg Doerr and Sjaak Brinkkemper},
  journal= {arXiv preprint arXiv:2506.11722},
  year   = {2025}
}

备注

Accepted at the Journal of Systems and Software (JSS); online appendix and supplementary material available at https://doi.org/10.5281/zenodo.15604749