中文

应用于两个苏丹阿拉伯语情感数据集的带新颖池化层的深度CNN架构

计算与语言 2022-02-01 v1 机器学习

摘要

阿拉伯语情感分析近年来已成为重要研究领域。最初工作聚焦于使用最广的现代标准阿拉伯语(MSA)。此后,针对包括埃及、黎凡特和摩洛哥在内的多种方言展开了研究。此外,已构建若干数据集以支撑此类工作。然而,迄今为止针对拥有3200万使用者的苏丹阿拉伯语方言的研究较少。本文引入两个新的公开数据集:二分类苏丹情感数据集(SudSenti2)和三分类苏丹情感数据集(SudSenti3)。进而提出一种CNN架构SCM,其由五层CNN及新颖池化层MMA组成,以提取最优特征。该SCM+MMA模型应用于SudSenti2与SudSenti3,准确率分别为92.75%与84.39%。随后,将该模型与其他深度学习分类器比较,证明在这些新数据集上更优。最后,将所提模型应用于已有的沙特情感数据集与MSA酒店阿拉伯语评论数据集,准确率分别为85.55%与90.01%。

关键词

引用

@article{arxiv.2201.12664,
  title  = {A Deep CNN Architecture with Novel Pooling Layer Applied to Two Sudanese Arabic Sentiment Datasets},
  author = {Mustafa Mhamed and Richard Sutcliffe and Xia Sun and Jun Feng and Eiad Almekhlafi and Ephrem A. Retta},
  journal= {arXiv preprint arXiv:2201.12664},
  year   = {2022}
}

备注

19 pages, 11 tables, 11 figures