BengaliSent140:面向仇恨与非仇恨言论分类的大型孟加拉二分类情感数据集
计算与语言
2026-01-29 v1 人工智能
摘要
孟加拉语情感分析研究近年来受到日益关注的注意。然而,进展仍受制于大规模且多样化的标注数据集的稀缺。虽然公开available的孟加拉语情感和仇恨言论数据集已有多个,但大多数规模有限或局限于单一领域,如社交媒体评论。因此,这些资源往往不足以训练需要大规模异构数据以学习稳健且可泛化表示的现代深度学习模型。在本工作中,我们引入BengaliSent140,一个由将七个现有的孟加拉语文本数据集整合成统一语料库而构成的大型孟加拉二分类情感数据集。为确保跨来源的一致性,我们系统性地将异构标注方案统一为二分类情感表述,包含两个类别:非仇恨(0)和仇恨(1)。最终数据集包含 139,792 个独特文本样本,包括 68,548 个仇恨样本和 71,244 个非仇恨样本,呈现较为均衡的类别分布。通过整合来自多个来源和领域的数据,BengaliSent140 相较于现有的孟加拉语情感数据集提供了更广泛的语言和情境覆盖,为训练和基准测试深度学习模型提供了坚实基础。我们还报告了基线实验结果,以Demonstrate该数据集的实际可用性。该数据集已公开提供。
引用
@article{arxiv.2601.20129,
title = {BengaliSent140: A Large-Scale Bengali Binary Sentiment Dataset for Hate and Non-Hate Speech Classification},
author = {Akif Islam and Sujan Kumar Roy and Md. Ekramul Hamid},
journal= {arXiv preprint arXiv:2601.20129},
year = {2026}
}
备注
Dataset paper. 6 pages, 3 figures. 4 Tables, Includes a publicly released Bengali sentiment dataset on Kaggle (BengaliSent140) and baseline experimental results