中文

LABR:大规模阿拉伯语情感分析基准

计算与语言 2015-05-05 v2 机器学习

摘要

我们介绍LABR,迄今为止最大的阿拉伯语情感分析数据集。它包含超过63,000条书评,每条评分从1到5星。我们研究了数据集的属性,并给出了其统计信息。我们探索将该数据集用于两个任务:(1)情感极性分类;(2)评分分类。此外,我们提供了数据集的标准划分,分为训练集、验证集和测试集,用于极性和评分分类,包括平衡和不平衡设置。我们通过进行全面的分析来扩展我们之前的工作。特别地,我们对通常用于情感极性分类问题的不同分类器进行了广泛的调查。我们还从数据集中构建了一个情感词典,包含单个和复合情感词,并探索了其有效性。我们公开了数据集和实验细节。

关键词

引用

@article{arxiv.1411.6718,
  title  = {LABR: A Large Scale Arabic Sentiment Analysis Benchmark},
  author = {Mahmoud Nabil and Mohamed Aly and Amir Atiya},
  journal= {arXiv preprint arXiv:1411.6718},
  year   = {2015}
}

备注

10 pages