BIDWESH:基于孟加拉语方言的仇恨言论检测数据集
计算与语言
2025-07-23 v1
摘要
数字平台上的仇恨言论已成为全球日益关注的问题,在孟加拉国等语言多样化的国家尤为如此,当地方言在日常交流中发挥着重要作用。尽管标准孟加拉语的仇恨言论检测已取得进展,但现有数据集和系统未能处理Barishal、Noakhali和Chittagong等方言中非正式且富有文化内涵的表达。这种疏忽导致检测能力受限和审核存在偏差,使大量有害内容未被处理。为填补这一空白,本研究引入了BIDWESH,这是首个多方言孟加拉语仇恨言论数据集,通过将BD-SHS语料库中的9,183个实例翻译并标注为三种主要地方方言构建而成。每个条目均经过人工验证,并针对仇恨存在与否、类型(诽谤、性别、宗教、煽动暴力)和目标群体(个人、男性、女性、群体)进行了标注,以确保语言和语境的准确性。由此产生的数据集为推进孟加拉语仇恨言论检测提供了一个语言丰富、平衡且具有包容性的资源。BIDWESH为开发对方言敏感的NLP工具奠定了基础,并为低资源语言环境下的公平且具备语境感知能力的内容审核做出了重要贡献。
引用
@article{arxiv.2507.16183,
title = {BIDWESH: A Bangla Regional Based Hate Speech Detection Dataset},
author = {Azizul Hakim Fayaz and MD. Shorif Uddin and Rayhan Uddin Bhuiyan and Zakia Sultana and Md. Samiul Islam and Bidyarthi Paul and Tashreef Muhammad and Shahriar Manzoor},
journal= {arXiv preprint arXiv:2507.16183},
year = {2025}
}