基于 Transformer 方法在资源受限语言中的情绪分类
计算与语言
2021-04-20 v1
摘要
尽管高资源语言的情绪分类研究已取得显著进展,但对于孟加拉语等资源受限语言而言仍处于起步阶段。然而,缺乏必要的语言处理工具以及基准语料的不足,使得孟加拉语的情绪分类任务更具挑战性和复杂性。本文提出一种基于 transformer 的技术,将孟加拉语文本分类为六种基本情绪之一:愤怒、恐惧、厌恶、悲伤、喜悦和惊讶。我们为分类任务构建了一个包含 6243 条文本的孟加拉语情绪语料库。实验使用了多种机器学习(LR、RF、MNB、SVM)、深度神经网络(CNN、BiLSTM、CNN+BiLSTM)以及 transformer(Bangla-BERT、m-BERT、XLM-R)方法。实验结果表明,XLM-R 在测试数据上以最高的加权 -score 优于所有其他技术。该数据集公开于 https://github.com/omar-sharif03/NAACL-SRW-2021。
引用
@article{arxiv.2104.08613,
title = {Emotion Classification in a Resource Constrained Language Using Transformer-based Approach},
author = {Avishek Das and Omar Sharif and Mohammed Moshiul Hoque and Iqbal H. Sarker},
journal= {arXiv preprint arXiv:2104.08613},
year = {2021}
}
备注
Accepted in NAACL-SRW 2021