基于词典算法和预训练语言模型 Bangla-BERT 的孟加拉文本情感分析混合方法
机器学习
2025-04-24 v2
摘要
情感分析 (SA) 是识别给定文本中情感基调或极性的过程,旨在揭示用户复杂的情感和内在感受。虽然情感分析在像英语这样的语言上已得到广泛研究,但关于孟加拉语的研究仍有限,尤其是针对细粒度情感分类。本工作旨在弥合这一差距,通过开发一种新方法将基于规则的算法与预训练语言模型相结合。我们从头构建了一个数据集,包含超过 15,000 条人工标注的评论。随后,我们构建了一个情感数据词典,为评论分配极性分数。我们开发了一种新型基于规则的算法 Bangla Sentiment Polarity Score (BSPS),该方法能够生成情感分数并将评论分类为九个不同的情感类别。为评估该方法的性能,我们使用 BanglaBERT——一个基于变换器的预训练语言模型,对分类后的情感进行评估。我们还对原始数据直接使用 BanglaBERT 进行情感分类,并评估了该模型的结果。我们的分析显示,BSPS + BanglaBERT 的混合方法优于单一的 BanglaBERT 模型,在准确率、精确率以及九个情感类别的细粒度分类方面均表现更佳。本研究的结果强调了在孟加拉语以及语言结构类似的语言中结合基于规则方法和预训练语言模型方法以实现情感分析增强价值,为未来研究和应用指明了方向。
引用
@article{arxiv.2411.19584,
title = {Enhancing Sentiment Analysis in Bengali Texts: A Hybrid Approach Using Lexicon-Based Algorithm and Pretrained Language Model Bangla-BERT},
author = {Hemal Mahmud and Hasan Mahmud and Mohammad Rifat Ahmmad Rashid},
journal= {arXiv preprint arXiv:2411.19584},
year = {2025}
}
备注
13 pages, 12 figures