中文

含文本转写的厌女多模态内容自动检测基准数据集

人工智能 2022-10-07 v1

摘要

在本文中,我们提出一个作为自动识别在线内容中厌女现象项目一部分生成的基准数据集,该项目特别关注表情包(meme)。此处描述的基准由从 Facebook、Twitter、Instagram 和 Reddit 等最流行社交媒体平台以及专门收集和创建表情包的网站收集的 800 个表情包组成。为收集厌女表情包,我们考虑了指代厌女内容的特定关键词作为搜索标准,涵盖了针对女性的不同仇恨表现,如身体羞辱、刻板印象、物化和暴力。同时,我们从相同网络来源手动下载了无厌女内容的表情包。在所有收集的表情包中,三位领域专家筛选出一个由 800 个表情包组成的数据集,其中厌女与非厌女表情包数量均衡。该数据集通过众包平台进行验证,涉及 60 名受试者参与标注过程,以便为每个实例收集三次评估。对于被评估为厌女的表情包,我们从专家和众包平台进一步收集了两个二元标签,涉及攻击性和反讽性。最后,每个表情包的文本均被手动转写。因此,所提供的数据集由 800 个表情包、专家给出的标签、众包验证获得的标签以及转写文本组成。这些数据可用于依托文本与视觉线索解决网络上厌女内容自动检测问题,应对如网络性别歧视和技术助长暴力等日益严重的现象。

关键词

引用

@article{arxiv.2106.08409,
  title  = {Benchmark dataset of memes with text transcriptions for automatic detection of multi-modal misogynistic content},
  author = {Francesca Gasparini and Giulia Rizzi and Aurora Saibene and Elisabetta Fersini},
  journal= {arXiv preprint arXiv:2106.08409},
  year   = {2022}
}