ANUBHUTI:用于孟加拉地区语言情感分析的全面语料库
计算与语言
2026-01-21 v2 机器学习
摘要
由于语言多样性和有限的标注数据,孟加拉地区方言的情感分析仍是一个未被充分探索的领域。本文介绍了ANUBHUTI,一个包含10,000个句子的全面数据集,这些句子经专家母语翻译者从标准孟加拉语手动翻译成四个主要地区方言:孟加拉孛其语、诺阿卡利语、西莱特语和米恩森斯语。该数据集主要包含政治和宗教内容,反映了孟加拉大国的当代社会政治格局,同时包含中性文本以保持平衡。每个句子采用双重标注方案进行标注:多类别主题标注将句子分类为政治、宗教或中性,多标签情感标注从愤怒、蔑视、厌恶、愉悦、恐惧、悲伤和惊讶等情感中分配一个或多个情感。专家母语翻译者完成翻译和标注,通过帕尔森Kappa值进行质量保证,确保各方言间的高度一致性。数据集经过系统检查后进行了缺失数据、异常和不一致性的筛选。ANUBHUTI填补了孟加拉地区语言情感分析资源方面的关键空白,使自然语言处理能够更准确地进行情境感知。
引用
@article{arxiv.2506.21686,
title = {ANUBHUTI: A Comprehensive Corpus For Sentiment Analysis In Bangla Regional Languages},
author = {Swastika Kundu and Autoshi Ibrahim and Mithila Rahman and Tanvir Ahmed},
journal= {arXiv preprint arXiv:2506.21686},
year = {2026}
}