你应当通过它留下的痕迹来认识工具:情感分析工具的可预测性
计算与语言
2024-10-21 v1
摘要
如果情感分析工具是有效的分类器,一个人会期望它们在不同类型的语料库和不同语言上提供可比的结果。与以前研究的结果一致,我们展示情感分析工具在相同数据集上存在分歧。超越以前的研究,我们展示情感分析工具用于情感标注的结果甚至可以被预测,从而揭示了情感分析的算法偏差。基于 Twitter、Wikipedia 和来自英语、德语和法语的不同新闻语料库,我们的分类器以平均 F1 分数为 0.89(针对英语语料库)将情感工具区分开来。我们因此警告不要将情感标注当作面向文件,主张需要更多和系统的 NLP 评估研究。
引用
@article{arxiv.2410.14626,
title = {You Shall Know a Tool by the Traces it Leaves: The Predictability of Sentiment Analysis Tools},
author = {Daniel Baumartz and Mevlüt Bagci and Alexander Henlein and Maxim Konca and Andy Lücking and Alexander Mehler},
journal= {arXiv preprint arXiv:2410.14626},
year = {2024}
}