LABR:大规模阿拉伯语情感分析基准
计算与语言
2015-05-05 v2 机器学习
摘要
我们介绍LABR,迄今为止最大的阿拉伯语情感分析数据集。它包含超过63,000条书评,每条评分从1到5星。我们研究了数据集的属性,并给出了其统计信息。我们探索将该数据集用于两个任务:(1)情感极性分类;(2)评分分类。此外,我们提供了数据集的标准划分,分为训练集、验证集和测试集,用于极性和评分分类,包括平衡和不平衡设置。我们通过进行全面的分析来扩展我们之前的工作。特别地,我们对通常用于情感极性分类问题的不同分类器进行了广泛的调查。我们还从数据集中构建了一个情感词典,包含单个和复合情感词,并探索了其有效性。我们公开了数据集和实验细节。
引用
@article{arxiv.1411.6718,
title = {LABR: A Large Scale Arabic Sentiment Analysis Benchmark},
author = {Mahmoud Nabil and Mohamed Aly and Amir Atiya},
journal= {arXiv preprint arXiv:1411.6718},
year = {2015}
}
备注
10 pages