一种用于比较基于词典的情感分析算法的统计新方法
计算与语言
2019-06-21 v1
摘要
基于词典的情感分析通常依赖于识别可赋予情感对应数值的各种词语。原则上,通过与被视为黄金标准的人工标注进行比较,可从这些算法获得分类器。在实践中,这在诸如葡萄牙语等缺乏人工标注文本的语言中是困难的。因此,为比较算法,次优步骤是不参照人工标注而直接相互比较不同算法。在本文中,我们开发了不依赖人工标注或已知类别标签的算法统计比较方法。我们将论证边际同质性检验以及最大似然估计框架内对数线性模型的用途。我们还将展示基于词典的情感分析中存在的某些不确定性可能类似于人工标注推文中出现的不确定性。我们还将展示不同算法输出中的变异性依赖于词典,并在对数线性模型框架内量化该输出中的变异性。
引用
@article{arxiv.1906.08717,
title = {A New Statistical Approach for Comparing Algorithms for Lexicon Based Sentiment Analysis},
author = {Mateus Machado and Evandro Ruiz and Kuruvilla Joseph Abraham},
journal= {arXiv preprint arXiv:1906.08717},
year = {2019}
}