EmoBang:基于文本的巴贝尔语情感检测
计算与语言
2025-11-11 v1
摘要
文本情感检测旨在基于语言线索识别个体的情感或心理状态——积极、消极或中性。尽管为英语和其他高资源语言取得了显著进展,但巴贝尔语仍未得到充分探索,尽管它是世界上第四大使用语言。缺乏大型标准化数据集将巴贝尔语归类为情感检测的低资源语言。现有研究主要采用传统机器学习模型配合传统特征工程,导致性能有限。本文引入了一个新的巴贝尔语情感数据集,覆盖八个情感类别,并提出两种自动情感检测模型:(i)一种混合卷积循环神经网络(Convolutional Recurrent Neural Network, CRNN)模型(EmoBangHybrid),以及(ii)一种AdaBoost双向编码器表示来自变换器(Bidirectional Encoder Representations from Transformers, BERT)的集成模型(EmoBangEnsemble)。此外,我们评估了六个基线模型和五种特征工程技术,并对该数据集上的零样本和少样本大型语言模型(LLM)进行评估。据我们了解,这是首个针对巴贝尔语情感检测的全面基准。实验结果表明,EmoBangH和EmoBangE分别实现了92.86%和93.69%的准确率,超越现有方法,为未来研究建立了强大的基线。
引用
@article{arxiv.2511.07077,
title = {EmoBang: Detecting Emotion From Bengali Texts},
author = {Abdullah Al Maruf and Aditi Golder and Zakaria Masud Jiyad and Abdullah Al Numan and Tarannum Shaila Zaman},
journal= {arXiv preprint arXiv:2511.07077},
year = {2025}
}