中文

社交网络阿拉伯语数据的语料库准备与停用词表生成

计算与语言 2014-10-07 v1

摘要

本文提出了一种从在线社交网络 (OSN) 和评论网站准备阿拉伯语语料库以用于情感分析 (SA) 任务的方法论。本文还提出了一种从已准备语料库生成停用词表的方法论。本文旨在调查移除停用词对 SA 任务的影响。问题在于,此前生成的停用词表是基于现代标准阿拉伯语 (MSA),而这并非 OSN 中使用的通用语言。我们生成了一份埃及方言停用词表和一份基于语料库的列表,以供 OSN 语料库使用。我们比较了在使用生成的列表、仅使用先前生成的 MSA 列表以及将埃及方言列表与 MSA 列表结合时,文本分类的效率。文本分类使用 Na"ive Bayes 和 Decision Tree 分类器以及两种特征选择方法(unigrams 和 bigram)进行。实验表明,包含埃及方言词汇的通用列表比仅使用 MSA 停用词列表具有更好的性能。

关键词

引用

@article{arxiv.1410.1135,
  title  = {Corpora Preparation and Stopword List Generation for Arabic data in Social Network},
  author = {Walaa Medhat and Ahmed H. Yousef and Hoda Korashy},
  journal= {arXiv preprint arXiv:1410.1135},
  year   = {2014}
}

备注

Language Engineering Conference 2014, Cairo, Egypt, 1-3 December 2014