BnSentMix:用于情感分析的多样化孟加拉语-英语代码混合数据集
计算与语言
2024-12-11 v3
摘要
代码混合数据的广泛可用性可以为低资源语言(如孟加拉语)提供有价值的见解,这些语言的数据集有限。情感分析一直是代码混合数据的跨语言基本文本分类任务。然而,目前尚缺乏大规模且多样化的代码混合孟加拉语情感分析数据集。我们通过引入BnSentMix来解决这一局限,该数据集包含来自Facebook、YouTube和电商网站的20,000个样本和4种情感标签。我们确保数据来源的多样性以复现真实的代码混合场景。此外,我们提出了14种基线方法,包括进一步在代码混合孟加拉语-英语上预训练的新型Transformer编码器,在情感分类任务上实现了69.8%的总体准确率和69.1%的F1分数。详细的分析揭示了不同情感标签和文本类型之间性能的差异,指出了未来改进的方向。
引用
@article{arxiv.2408.08964,
title = {BnSentMix: A Diverse Bengali-English Code-Mixed Dataset for Sentiment Analysis},
author = {Sadia Alam and Md Farhan Ishmam and Navid Hasin Alvee and Md Shahnewaz Siddique and Md Azam Hossain and Abu Raihan Mostofa Kamal},
journal= {arXiv preprint arXiv:2408.08964},
year = {2024}
}
备注
LoResLM at COLING 2025