中文

BanglaAbuseMeme:一个孟加拉语滥用表情包分类数据集

计算机视觉与模式识别 2023-10-19 v1

摘要

社交媒体平台用于信息共享的使用量急剧增加,也助长了网络滥用的快速增长。虐待个人或群体的一种简单而有效的方式是制作表情包,其通常将图像与叠加于其上的简短文本相融合。此类有害元素正被泛滥使用,并对在线安全构成威胁。因此有必要开发高效模型来检测并标记滥用表情包。在低资源环境下(例如孟加拉语表情包,即嵌有孟加拉语文本的图像),由于缺少可供AI模型训练的基准数据集,该问题更具挑战性。本文通过构建孟加拉语表情包数据集来弥补这一缺口。为建立有效基准,我们利用该数据集实现了若干用于分类滥用表情包的基线模型。我们观察到,同时使用文本与视觉信息的多模态模型优于单模态模型。我们性能最佳的模型取得了70.51的宏F1分数。最后,我们对性能最佳基于文本、基于图像及多模态模型的误分类表情包进行了定性误差分析。

关键词

引用

@article{arxiv.2310.11748,
  title  = {BanglaAbuseMeme: A Dataset for Bengali Abusive Meme Classification},
  author = {Mithun Das and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2310.11748},
  year   = {2023}
}

备注

EMNLP 2023 (main conference)