推文情感量化:一项实验性再评估
计算与语言
2021-09-21 v3 人工智能
信息检索
机器学习
摘要
情感量化是通过监督学习训练估计器,以估计未标注文本样本中情感相关类别(如 \textsf{Positive}、\textsf{Neutral}、\textsf{Negative})的相对频率(亦称“流行率”)的任务。当这些文本为推文时,该任务尤为重要,因为在 Twitter 数据上开展的大多数情感分类工作的最终目标实际上是量化(而非对单条推文进行分类)。众所周知,通过“分类并计数”(即利用标准分类器对所有未标注项分类,并统计被指派至给定类别的项数)来解决量化问题在准确性上并非最优,且存在更准确的量化方法。Gao 与 Sebastiani(2016)在推文情感量化任务上对量化方法进行了系统比较。事后看来,我们观察到该工作所遵循的实验协议薄弱,因此从中得出结论的可靠性存疑。我们现在在完全相同的同一数据集上重新评估那些量化方法(外加若干更现代的方法),此次遵循现已成熟且稳健得多的实验协议(其中还涉及在测试数据中模拟与训练集差异极大的类别流行率值)。该实验协议(即便不计入新添方法)所涉及的实验数量是原研究的 5,775 倍。我们的实验结果与原 Gao 和 Sebastiani 所得结果截然不同,并为不同情感量化方法的相对优劣提供了不同且扎实得多的理解。
引用
@article{arxiv.2011.08091,
title = {Tweet Sentiment Quantification: An Experimental Re-Evaluation},
author = {Alejandro Moreo and Fabrizio Sebastiani},
journal= {arXiv preprint arXiv:2011.08091},
year = {2021}
}