中文

孟加拉语文本内容的情感分类:一项比较研究

计算与语言 2020-11-23 v1 信息检索 机器学习

摘要

情感分析已被广泛用于理解我们对社会和政治议程的看法,或用户对产品的体验。它是 NLP 中核心且研究较为充分的领域之一。然而,对于像孟加拉语这样的低资源语言,一个显著的挑战是资源的缺乏。当前孟加拉语文献中另一个重要的局限是,由于缺乏明确规定的训练/测试划分,缺少可比较的结果。在本研究中,我们探索了多个公开可用的情感标注数据集,并使用经典算法和深度学习算法设计了分类器。在我们的研究中,经典算法包括 SVM 和随机森林,深度学习算法包括 CNN、FastText 以及基于 transformer 的模型。我们在模型性能和时间-资源复杂度方面对这些模型进行了比较。我们的发现表明,先前未在孟加拉语中探索过的基于 transformer 的模型优于所有其他模型。此外,我们基于每一类的效价分数创建了词典内容的加权列表。随后,我们分析了数据集中每一类具有高显著性特征的条目。为了可复现性,我们公开提供了数据划分和排序后的词典列表。所呈现的结果可作为未来研究的基准。

关键词

引用

@article{arxiv.2011.10106,
  title  = {Sentiment Classification in Bangla Textual Content: A Comparative Study},
  author = {Md. Arid Hasan and Jannatul Tajrin and Shammur Absar Chowdhury and Firoj Alam},
  journal= {arXiv preprint arXiv:2011.10106},
  year   = {2020}
}

备注

Accepted at ICCIT-2020