中文

基于深度学习技术的僧伽罗语情感分析

计算与语言 2020-11-17 v1 机器学习

摘要

由于机器学习和深度学习快速演进领域的高度影响,自然语言处理(NLP)任务对于英语和中文等高资源语言已获得全面提升的性能。然而,僧伽罗语作为一种形态丰富但资源匮乏的语言,尚未经历这些进展。在情感分析方面,此前仅有两项采用深度学习方法的研宄,且仅关注二元情形的文档级情感分析,仅试验了三类深度学习模型。相比之下,本文对标准序列模型(如RNN、LSTM、Bi-LSTM)以及较新的SOTA模型(如层次注意力混合神经网络和胶囊网络)的使用进行了更为全面的研究。分类在文档级进行,但通过对积极、消极、中性和冲突类进行考量而具有更细粒度。我们公开了一个包含15059条僧伽罗语新闻评论的数据集,标注有这四类,以及一个由948万词符组成的语料库。这是迄今为止最大的僧伽罗语情感标注数据集。

关键词

引用

@article{arxiv.2011.07280,
  title  = {Sentiment Analysis for Sinhala Language using Deep Learning Techniques},
  author = {Lahiru Senevirathne and Piyumal Demotte and Binod Karunanayake and Udyogi Munasinghe and Surangika Ranathunga},
  journal= {arXiv preprint arXiv:2011.07280},
  year   = {2020}
}