中文

T-FREX:一种基于 Transformer 的移动应用评论特征提取方法

软件工程 2024-08-05 v1

摘要

移动应用评论是软件相关知识生成活动(包括软件维护、演化和反馈分析)的大规模数据源。从这些评论中有效提取特征(即功能或特性)是支持特征接受度分析、识别相关新特征请求以及确定特征开发优先级等的关键。传统方法侧重于基于句法模式的方法,通常不依赖上下文,在封闭的应用集合上进行评估,难以复现,且局限于有限的应用集合和领域。同时,基于 Transformer 架构的大型语言模型(LLM)在软件工程任务中的普及,为实证评估这些模型支持特征提取的性能奠定了基础。在本研究中,我们提出了 T-FREX,一种基于 Transformer 的、全自动的移动应用评论特征提取方法。首先,我们从一个真实的众包软件推荐平台收集用户的一组真实特征,并将其自动转换为应用评论数据集。然后,我们使用这个新创建的数据集,在不同的数据配置下对多个 LLM 进行命名实体识别任务的微调。我们基于该真实特征评估 T-FREX 的性能,并通过将 T-FREX 与该领域的基线方法进行比较来补充我们的分析。最后,我们通过外部人工评估来评估 T-FREX 预测的新特征的质量。结果表明,T-FREX 平均优于传统的基于句法的方法,尤其是在从模型已微调的领域中发现新特征时。

关键词

引用

@article{arxiv.2401.03833,
  title  = {T-FREX: A Transformer-based Feature Extraction Method from Mobile App Reviews},
  author = {Quim Motger and Alessio Miaschi and Felice Dell'Orletta and Xavier Franch and Jordi Marco},
  journal= {arXiv preprint arXiv:2401.03833},
  year   = {2024}
}

备注

Accepted at IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2024). 12 pages (including references), 5 figures, 4 tables