基于深度循环模型的孟加拉语与罗马化孟加拉语文本情感分析
计算与语言
2016-11-28 v2 信息检索
机器学习
神经与进化计算
摘要
情感分析(SA)是数字时代的一个行动研究领域。随着在线社交媒体站点和服务的快速持续增长,以及其中可用的诸如状态、评论、评价等文本数据量的增加,自动 SA 的应用正在兴起。然而,自然语言处理(NLP)中大多数关于 SA 的研究工作基于英语。尽管孟加拉语是世界第六大广泛使用的语言,它仍然没有大型标准数据集。因此,近期孟加拉语的研究工作未能产生既可与他人工作相比较又可作为未来研究者在该领域进展的基石而被复用的结果。因此,我们首先试图提供一个文本数据集——它不仅包含孟加拉语,也包含罗马化孟加拉语文本,数量可观、经过后处理并多重验证,准备好用于 SA 实验。我们在深度循环模型中测试了该数据集,具体地,长短期记忆网络(LSTM),使用两类损失函数——二分类交叉熵和分类交叉熵,并且还通过使用一个验证集的数据预训练另一个验证集反之亦然来做一些实验性预训练。最后,我们记录了结果以及对其的一些分析,结果是大有希望的。
引用
@article{arxiv.1610.00369,
title = {Sentiment Analysis on Bangla and Romanized Bangla Text (BRBT) using Deep Recurrent models},
author = {A. Hassan and M. R. Amin and N. Mohammed and A. K. A. Azad},
journal= {arXiv preprint arXiv:1610.00369},
year = {2016}
}