中文

面向目标感知的双注意力框架:检索增强的多模态孔加拉仇恨 meme 检测

计算与语言 2026-02-24 v1

摘要

社交媒体上的仇恨内容日益以多模态 meme 形式出现,这类内容将图像和文本组合以传递有害叙事。在资源匮乏的孔加拉语等低资源语言上进行自动检测仍具有挑战性,主要due to 标注数据有限、类别不平衡以及普遍的代码混合现象。为此,我们通过从孔加拉语多模态攻击数据集(MIMOSA)中获取语义对齐的样本来扩充孔加拉语仇恨 meme 数据集(BHM),从而改善类别平衡性和语义多样性。我们提出了增强型双注意力框架(xDORA),集成视觉编码器(CLIP、DINOv2)和多语言文本编码器(XGLM、XLM-R)通过加权注意力池化学习鲁棒的跨模态表征。基于这些嵌入,我们开发了一个基于 FAISS 的k近邻分类器进行非参数推断,并引入了RAG-Fused DORA,该模型融合检索驱动的上下文推理。我们进一步评估了LLaVA在零样本、少样本和检索增强提示设置下的表现。在扩展后的数据集上,xDORA(CLIP + XLM-R)实现了仇恨 meme 识别和目标实体检测的宏平均F1分数分别为0.78和0.71,而RAG-Fused DORA的性能提升至0.79和0.74,相较于DORA基线模型取得显著提升。FAISS基于分类器在少数类别方面表现具有竞争力, demonstrate了通过语义相似性建模的鲁棒性。在 contrastively, LLaVA在少样本设置下表现有限,仅在检索增强下获得有限的改进,这凸显了在未微调的情况下,预训练视觉语言模型对于代码混合孔加拉语内容的局限性。这些发现表明,监督式、检索增强和非参数多模态框架在 addressing 语言和文化复杂性方面具有有效性。

关键词

引用

@article{arxiv.2602.19212,
  title  = {Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection},
  author = {Raihan Tanvir and Md. Golam Rabiul Alam},
  journal= {arXiv preprint arXiv:2602.19212},
  year   = {2026}
}