ArSentD-LEV:面向阿拉伯黎凡特方言推文的目标级情感分析多主题语料库
计算与语言
2019-06-06 v1 信息检索
机器学习
机器学习
摘要
情感分析是一项高度主观且富有挑战性的任务。当应用于阿拉伯语时,其复杂性进一步增加,主要原因在于网络上(尤其是社交媒体中)大量使用且未标准化的各类方言。尽管已发布许多用于训练阿拉伯语情感分类器的数据集,但其中大多数仅包含浅层标注,仅标记文本单元(如词、句或文档)的情感。本文提出黎凡特方言阿拉伯语情感推文数据集(ArSenTD-LEV)。基于对黎凡特地区推文的分析结果,我们构建了包含 4,000 条推文的数据集,标注如下:推文的整体情感、情感所指向的目标、情感的表达方式,以及推文的主题。结果证实了这些标注在提升基线情感分类器性能方面的重要性,同时也证实了在特定领域训练而在另一领域测试所存在的差距。
引用
@article{arxiv.1906.01830,
title = {ArSentD-LEV: A Multi-Topic Corpus for Target-based Sentiment Analysis in Arabic Levantine Tweets},
author = {Ramy Baly and Alaa Khaddaj and Hazem Hajj and Wassim El-Hajj and Khaled Bashir Shaban},
journal= {arXiv preprint arXiv:1906.01830},
year = {2019}
}
备注
Corpus development, Levantine tweets, multi-topic, sentiment analysis, sentiment target, LREC-2018, OSACT-2018