情感分析自动标注方法的比较
计算与语言
2022-11-08 v1 数字图书馆
机器学习
社会与信息网络
摘要
为监督式机器学习任务标注大量社交媒体数据不仅耗时,而且困难且昂贵。另一方面,监督式机器学习模型的准确率与其所训练的标注数据质量密切相关,而自动情感标注技术可减少人工标注的时间与成本。我们比较了三种自动情感标注技术:TextBlob、Vader 和 Afinn,以在无需任何人工辅助的情况下为推文分配情感。我们比较了三种场景:第一种使用带有现有真实标签的训练与测试数据集;第二个实验使用自动标签作为训练与测试数据集;第三个实验使用三种自动标注技术标注训练数据集,并使用真实标签进行测试。实验在两个 Twitter 数据集上评估:SemEval-2013 (DS-1) 和 SemEval-2016 (DS-2)。结果表明,使用 BiLSTM 深度学习模型时,Afinn 标注技术在 DS-1 和 DS-2 上分别取得了 80.17% 和 80.05% 的最高准确率。这些发现意味着自动文本标注可带来显著益处,并为替代耗时耗力的人工标注工作提供了一种可行的替代方案。
引用
@article{arxiv.2211.02976,
title = {A Comparison of Automatic Labelling Approaches for Sentiment Analysis},
author = {Sumana Biswas and Karen Young and Josephine Griffith},
journal= {arXiv preprint arXiv:2211.02976},
year = {2022}
}
备注
12 pages 3 figure, 11th International Conference on Data Science, Technology and Applications, ISBN 978-989-758-583-8, ISSN 2184-285X, pages 312-319