中文

面向软件工程数据集的独立情感检测工具集成有效性实证研究

软件工程 2021-11-08 v1 机器学习

摘要

软件工程(SE)中的情感分析已显示出分析和支持多样化开发活动的潜力。我们报告了一项实证研究的结果,该研究的目的是确定通过组合独立的 SE 专用情感检测器的极性标签来开发集成引擎的可行性。我们的研究分为两个阶段。在第一阶段,我们从 Lin 等人最近发表的两篇论文 [31, 32] 中选取了五个 SE 专用情感检测工具,他们首先报告了独立情感检测器的负面结果,随后提出了一种改进的 SE 专用情感检测器 POME [31]。我们报告了基于六个当前可用的 SE 情感基准的 17,581 个单元(句子/文档)的研究结果。我们发现现有工具在 85-95% 的情况下可以互补,即一个错误但另一个正确。然而,基于多数投票的这些工具集成未能提高情感检测的准确性。我们开发了 Sentisead,一种通过组合极性标签和词袋作为特征的有监督工具。Sentisead 将单个工具的性能(F1-score)提升了 4%(相对于 Senti4SD [5])至 100%(相对于 POME [31])。在第二阶段,我们使用预训练 Transformer 模型(PTMs)比较并改进 Sentisead 基础设施。我们发现,以 RoBERTa 作为来自 Lin 等人 [31, 32] 的五个独立基于规则和浅层学习的 SE 专用工具集成的 Sentisead 基础设施在六个数据集上取得了最佳的 F1-score 0.805,而独立的 RoBERTa 的 F1-score 为 0.801。

关键词

引用

@article{arxiv.2111.03196,
  title  = {An Empirical Study of the Effectiveness of an Ensemble of Stand-alone Sentiment Detection Tools for Software Engineering Datasets},
  author = {Gias Uddin and Yann-Gael Gueheneuc and Foutse Khomh and Chanchal K Roy},
  journal= {arXiv preprint arXiv:2111.03196},
  year   = {2021}
}