中文

标注指南与标注数据对从应用评论中提取应用特征的影响

信息检索 2018-10-15 v1 机器学习 机器学习

摘要

用于指导训练和评估数据集标注的标注指南会对机器学习模型的质量产生显著影响。在本研究中,我们探究标注指南对应用特征提取模型质量的影响。作为主要结果,我们提出了对现有标注指南的几项修改,旨在使提取的应用特征对应用开发者更有用且更具信息量。我们通过模拟新标注指南的应用,然后评估在初始指南标注和模拟指南标注的数据集上训练的有监督机器学习模型的性能来检验所提修改。尽管与在初始标注数据集上训练的模型相比,自动应用特征提取的整体性能保持不变,但在模拟新标注数据集上训练的模型所提取的特征噪声更小,且对应用开发者更具信息量。其次,我们关注训练自动应用特征提取模型需要何种标注训练数据。具体而言,我们探究训练集是否应包含随后计划应用该模型的那些应用/应用类别上的标注评论,还是说拥有任意可用应用的标注评论就足以训练,即便这些应用与测试应用类别差异很大。我们的实验表明,拥有来自测试应用的标注训练评论并非必要,尽管将其纳入训练集有助于提升召回率。此外,我们检验用标注产品评论扩充训练集是否有助于提升应用特征提取性能。我们发现,在扩充训练集上训练的模型带来了召回率的提升,但代价是精确率下降。

关键词

引用

@article{arxiv.1810.05187,
  title  = {The Impact of Annotation Guidelines and Annotated Data on Extracting App Features from App Reviews},
  author = {Faiz Ali Shah and Kairit Sirts and Dietmar Pfahl},
  journal= {arXiv preprint arXiv:1810.05187},
  year   = {2018}
}