基于 Transformer 模型的孟加拉语情感分析里程碑:基础、挑战与未来方向
计算与语言
2024-01-17 v1
摘要
情感分析(SA)是指为给定文本关联一个观点极性(通常为正面、负面或中性;甚至可以是细粒度的,如略带愤怒、悲伤等)的任务,本质上将其归结为一个有监督(因为我们预先拥有观点标签)的分类任务。尽管由于 Transformer 架构的出现,在英语等资源丰富的语言中情感分析得到了大量研究,从而极大地推动了最先进水平(SOTA)的发展,但对于孟加拉语(BN)等资源贫乏的语言却并非如此。对于一门大约有 3 亿人使用的语言,使他们能够用自己偏好的语言进行尝试的技术却严重缺乏。在本文中,我们分析了孟加拉语情感分析的最先进水平,特别是基于 Transformer 的模型。我们讨论了可用的数据集及其缺陷,与孟加拉语相关的细微差别(即是什么使得在该语言上应用情感分析具有挑战性),并最终为缓解该领域局限性的未来方向提供了见解。
引用
@article{arxiv.2401.07847,
title = {Milestones in Bengali Sentiment Analysis leveraging Transformer-models: Fundamentals, Challenges and Future Directions},
author = {Saptarshi Sengupta and Shreya Ghosh and Prasenjit Mitra and Tarikul Islam Tamiti},
journal= {arXiv preprint arXiv:2401.07847},
year = {2024}
}