评估软件工程中用于用户反馈分析的预训练模型:以应用评论分类为例的研究
软件工程
2022-04-08 v3 机器学习
摘要
背景:用户在应用商店或社交媒体上撰写的移动应用评论是应用开发者的重要资源。分析应用评论已被证明对软件工程的许多领域(例如需求工程、测试)有用。应用评论的自动分类需要大量人工整理标注数据集的工作。当分类目的改变时(例如识别缺陷与可用性问题或情感),需要标注新的数据集,这阻碍了所开发模型在实践中向新的所需类别/任务的扩展。近期的预训练神经语言模型(PTM)以无监督方式在大型语料库上训练,并在解决类似的自然语言处理问题中取得成功。然而,PTM在应用评论分类中的适用性尚未被探索。目标:我们研究PTM相较于现有模型在应用评论分类中的优势,以及PTM在多种设置下的可迁移性。方法:我们使用文献中的六个数据集,实证研究了PTM与先前方法在准确率和时间效率上的对比。此外,我们研究了在应用评论上训练的PTM(即领域特定PTM)的性能。我们设置了不同的研究以在多种设置下评估PTM:二分类与多分类、零样本分类(当新标签引入模型时)、多任务设置,以及来自不同资源的评论分类。数据集为来自Google Play商店、Apple App商店和Twitter数据的手动标注应用评论数据集。在所有情况下,将使用微平均和宏平均的精确率、召回率和F1分数,并报告模型训练和预测所需的时间。
引用
@article{arxiv.2104.05861,
title = {Evaluating Pre-Trained Models for User Feedback Analysis in Software Engineering: A Study on Classification of App-Reviews},
author = {Mohammad Abdul Hadi and Fatemeh H. Fard},
journal= {arXiv preprint arXiv:2104.05861},
year = {2022}
}
备注
55 pages, 13 tables, 6 figures, EMSE 2022