利用编码器-only 大语言模型进行移动应用评论特征提取
计算与语言
2025-05-30 v2 软件工程
摘要
移动应用评论分析面临独特挑战,包括低质量、主观偏见以及噪声内容。从这些用户生成的文档中提取特征对于任务如特征优先级排序和情感分析至关重要,但仍然具有挑战性。与此同时,基于Transformer架构的编码器-only 模型在多个软件工程流程的分类和信息提取任务中显示出前景。本研究探讨了编码器-only 大语言模型能否提升从移动应用评论中提取特征的假设。通过利用来自工业背景的众包标注,我们将特征提取重新定义为监督token 分类任务。我们的方法包括利用大型用户评论语料库扩展模型的预训练,以提高情境理解,并采用实例选择技术以优化模型微调。经验评估表明,该方法提高了提取特征的精确率和召回率,并增强了性能效率。关键贡献包括一种新颖的特征提取方法、标注数据集、扩展的预训练模型以及一种用于高性价比微调的实例选择机制。该研究为将大语言模型应用于自然语言处理任务(尤其是移动应用评论)提供了实用方法和实证证据,显著提升了特征提取性能。
引用
@article{arxiv.2408.01063,
title = {Leveraging Encoder-only Large Language Models for Mobile App Review Feature Extraction},
author = {Quim Motger and Alessio Miaschi and Felice Dell'Orletta and Xavier Franch and Jordi Marco},
journal= {arXiv preprint arXiv:2408.01063},
year = {2025}
}
备注
46 pages, 7 tables, 11 figures