中文

软件项目中情绪的主观性:预标注数据集用于情感分析究竟有多可靠?

软件工程 2022-07-19 v1

摘要

软件项目的社会性方面对于研究和实践变得愈发重要。不同的方法用于分析开发团队的情绪,从简单地询问团队到所谓的基于文本沟通的 sentiment analysis(情感分析)。这些情感分析工具使用来自不同来源的预标注数据集进行训练,包括 GitHub 和 Stack Overflow。在本文中,我们调查数据集中语句的标注是否与软件项目团队潜在成员的感知一致。基于一项国际调查,我们将 94 名参与者的中位感知与预标注数据集以及每位参与者与预定义标注的一致性进行比较。我们的结果指出了三个显著发现:(1) 尽管中位值在 62.5% 的情况下与数据集的预定义标注一致,我们观察到单个参与者的评分与标注之间存在巨大差异;(2) 没有一名参与者完全同意预定义标注;以及 (3) 标注基于指南的数据集表现优于临时标注的数据集。

关键词

引用

@article{arxiv.2207.07954,
  title  = {On the Subjectivity of Emotions in Software Projects: How Reliable are Pre-Labeled Data Sets for Sentiment Analysis?},
  author = {Marc Herrmann and Martin Obaidi and Larissa Chazette and Jil Klünder},
  journal= {arXiv preprint arXiv:2207.07954},
  year   = {2022}
}

备注

Accepted for publication in the Elsevier Journal of Systems and Software: Special Issue on Human-Centric Software Engineering - Approaches, Technologies, and Applications