中文

基于 Transformer 方法在资源受限语言中的情绪分类

计算与语言 2021-04-20 v1

摘要

尽管高资源语言的情绪分类研究已取得显著进展,但对于孟加拉语等资源受限语言而言仍处于起步阶段。然而,缺乏必要的语言处理工具以及基准语料的不足,使得孟加拉语的情绪分类任务更具挑战性和复杂性。本文提出一种基于 transformer 的技术,将孟加拉语文本分类为六种基本情绪之一:愤怒、恐惧、厌恶、悲伤、喜悦和惊讶。我们为分类任务构建了一个包含 6243 条文本的孟加拉语情绪语料库。实验使用了多种机器学习(LR、RF、MNB、SVM)、深度神经网络(CNN、BiLSTM、CNN+BiLSTM)以及 transformer(Bangla-BERT、m-BERT、XLM-R)方法。实验结果表明,XLM-R 在测试数据上以最高的加权 f1f_1-score 69.73%69.73\% 优于所有其他技术。该数据集公开于 https://github.com/omar-sharif03/NAACL-SRW-2021。

关键词

引用

@article{arxiv.2104.08613,
  title  = {Emotion Classification in a Resource Constrained Language Using Transformer-based Approach},
  author = {Avishek Das and Omar Sharif and Mohammed Moshiul Hoque and Iqbal H. Sarker},
  journal= {arXiv preprint arXiv:2104.08613},
  year   = {2021}
}

备注

Accepted in NAACL-SRW 2021