面向软件工程中可信情感分析:数据集特征与工具选择
软件工程
2025-07-11 v2
摘要
软件开发严重依赖基于文本的交流,这使得情感分析成为理解团队动态和支持需求工程中可信 AI 驱动分析的宝贵工具。然而,由于交流风格和内容的差异,现有的情感分析工具在不同平台的数据集上表现往往不一致。在本研究中,我们分析了来自五个平台的 10 个开发者交流数据集的语言和统计特征,并评估了 14 种情感分析工具的性能。基于这些结果,我们提出了一种映射方法和问卷,以数据集的特征作为输入,为新数据集推荐合适的情感分析工具。我们的结果表明,可以利用数据集特征来改进工具选择,因为不同平台在语言和统计属性上存在显著差异。虽然基于 Transformer 的模型(如 SetFit 和 RoBERTa)持续取得强劲表现,但工具的有效性仍取决于上下文。我们的方法支持研究人员和从业者选择用于软件工程情感分析的可信工具,同时强调随着交流语境的演变,需要持续进行评估。
引用
@article{arxiv.2507.02137,
title = {Towards Trustworthy Sentiment Analysis in Software Engineering: Dataset Characteristics and Tool Selection},
author = {Martin Obaidi and Marc Herrmann and Jil Klünder and Kurt Schneider},
journal= {arXiv preprint arXiv:2507.02137},
year = {2025}
}
备注
This paper has been accepted at the RETRAI workshop of the 33rd IEEE International Requirements Engineering Workshop (REW 2025)