中文

结合词汇特征与监督学习方法的阿拉伯语情感分析

计算与语言 2017-10-26 v1

摘要

在过去几年中,构建面向阿拉伯语社交媒体的情感分析工具的重要性已被认识到,尤其是随着阿拉伯语社交媒体用户数量的快速增长。解决该问题的主要困难之一是社交媒体中的文本多为口语化,且各社交平台使用多种方言。本文提出一组特征,其与一个基于机器学习的情感分析模型相集成,并应用于埃及、沙特、黎凡特及MSA阿拉伯语的社交媒体数据集。许多所提特征通过利用阿拉伯语情感词典导出。该模型还给出了基于表情符号的特征,以及输入文本相关特征,如文本内片段数量、文本长度、文本是否以问号结尾等。我们表明,所提特征在我们实验的七个数据集(均为基准数据集)中的六个上提升了准确率。由于所开发模型优于所有拥有公开可用数据集的现有阿拉伯语情感分析系统,我们可以说该模型呈现了阿拉伯语情感分析的最先进水平。

关键词

引用

@article{arxiv.1710.08451,
  title  = {Combining Lexical Features and a Supervised Learning Approach for Arabic Sentiment Analysis},
  author = {Samhaa R. El-Beltagy and Talaat Khalil and Amal Halaby and Muhammad Hammad},
  journal= {arXiv preprint arXiv:1710.08451},
  year   = {2017}
}

备注

arXiv admin note: This version has been removed because it is in violation of arXiv's copyright policy