GitHub 问题能否助力应用评论分类?
软件工程
2025-07-15 v3
摘要
应用评论反映了各类用户需求,可辅助规划维护任务。近来,用于自动分类用户评论的已有方法依赖于机器学习算法。先前一项研究表明,基于现有标注数据集训练的模型在预测新数据集时表现不佳。因此,一个全面的标注数据集对于训练更精确的模型至关重要。在本文中,我们提出一种新方法,通过利用来自额外来源 GitHub 问题(其中包含关于用户需求的宝贵信息)提取的信息来辅助扩充标注数据集。首先,我们通过检查问题标签来识别涉及评论意图(错误报告、功能请求等)的问题。然后,我们分析问题正文并定义 19 种语言模式以提取目标信息。最后,我们通过应用内、上下文内和应用间分析方法,用经过处理的问题子集扩充人工标注的评论数据集。我们进行了若干实验来评估所提方法。我们的结果表明,使用标注问题进行数据扩充可将错误报告的 F1-score 提升至 6.3,功能请求提升至 7.2。此外,我们确定辅助量的有效范围为 0.3 至 0.7,可带来更好的性能提升。
引用
@article{arxiv.2308.14211,
title = {Can GitHub Issues Help in App Review Classifications?},
author = {Yasaman Abedini and Abbas Heydarnoori},
journal= {arXiv preprint arXiv:2308.14211},
year = {2025}
}