BanglaAbuseMeme:一个孟加拉语滥用表情包分类数据集
计算机视觉与模式识别
2023-10-19 v1
摘要
社交媒体平台用于信息共享的使用量急剧增加,也助长了网络滥用的快速增长。虐待个人或群体的一种简单而有效的方式是制作表情包,其通常将图像与叠加于其上的简短文本相融合。此类有害元素正被泛滥使用,并对在线安全构成威胁。因此有必要开发高效模型来检测并标记滥用表情包。在低资源环境下(例如孟加拉语表情包,即嵌有孟加拉语文本的图像),由于缺少可供AI模型训练的基准数据集,该问题更具挑战性。本文通过构建孟加拉语表情包数据集来弥补这一缺口。为建立有效基准,我们利用该数据集实现了若干用于分类滥用表情包的基线模型。我们观察到,同时使用文本与视觉信息的多模态模型优于单模态模型。我们性能最佳的模型取得了70.51的宏F1分数。最后,我们对性能最佳基于文本、基于图像及多模态模型的误分类表情包进行了定性误差分析。
引用
@article{arxiv.2310.11748,
title = {BanglaAbuseMeme: A Dataset for Bengali Abusive Meme Classification},
author = {Mithun Das and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2310.11748},
year = {2023}
}
备注
EMNLP 2023 (main conference)