检测孟加拉语模因中的仇恨与煽动性内容:一个新的多模态数据集与协同注意力框架
计算与语言
2026-02-27 v1
摘要
网络模因已成为社交媒体上一种主要的表达形式,包括在孟加拉语社区中。虽然模因通常具有幽默性,但也可能被利用来传播针对个人和群体的攻击性、有害和煽动性内容。由于其讽刺、微妙和文化特定的性质,检测此类内容极具挑战性。对于像孟加拉语这样的低资源语言,这个问题更加突出,因为现有研究主要集中于高资源语言。为了解决这一关键的研究空白,我们引入了Bn-HIB(孟加拉语仇恨煽动良性),一个包含3,247个手动标注的孟加拉语模因的新数据集,这些模因被分类为良性、仇恨或煽动性。值得注意的是,Bn-HIB是第一个在孟加拉语模因中区分煽动性内容与直接仇恨言论的数据集。此外,我们提出了MCFM(多模态协同注意力融合模型),一种简单而有效的架构,它相互分析模因的视觉和文本元素。MCFM采用协同注意力机制来识别并融合来自每种模态的最关键特征,从而实现更准确的分类。我们的实验表明,MCFM在Bn-HIB数据集上显著优于几种最先进的模型,证明了其在此类细微任务中的有效性。警告:本作品包含可能令部分读者不适的内容。建议观众酌情观看。
引用
@article{arxiv.2602.22391,
title = {Detecting Hate and Inflammatory Content in Bengali Memes: A New Multimodal Dataset and Co-Attention Framework},
author = {Rakib Ullah and Mominul islam and Md Sanjid Hossain and Md Ismail Hossain},
journal= {arXiv preprint arXiv:2602.22391},
year = {2026}
}
备注
6 pages, 8 figures