中文

MONOVAB:一个用于孟加拉语多标签情感检测的标注语料库

机器学习 2025-05-06 v2 计算与语言

摘要

近年来,情感分析(SA)与情绪识别(ER)在孟加拉语中日益流行,孟加拉语是全球第七大使用人数的语言。然而,该语言结构复杂,使得这一领域难以准确提取情绪。若干不同的方法,如正负面情感提取以及多类情绪提取,已在该研究领域中得到应用。尽管如此,多情感提取在该语言中几乎是一个未被触及的领域,其涉及基于单条文本识别多种感受。因此,本研究展示了一种基于从 Facebook 爬取数据构建标注语料库的详尽方法,以弥合该主题领域的空白并克服相关挑战。为使该标注更具成效,采用了基于上下文的方法。Transformer 的著名方法双向编码器表示(BERT)在所有已实现的方法中表现出最佳结果。最后,开发了一个 Web 应用来展示预训练最佳性能模型(BERT)在孟加拉语多标签 ER 上的表现。

关键词

引用

@article{arxiv.2309.15670,
  title  = {MONOVAB : An Annotated Corpus for Bangla Multi-label Emotion Detection},
  author = {Sumit Kumar Banshal and Sajal Das and Shumaiya Akter Shammi and Narayan Ranjan Chakraborty and Aulia Luqman Aziz and Mohammed Aljuaid and Fazla Rabby and Rohit Bansal},
  journal= {arXiv preprint arXiv:2309.15670},
  year   = {2025}
}