中文

构建用于研究侮辱性语言的多模态图像与文本数据集

计算与语言 2020-05-06 v1

摘要

为了研究在线仇恨言论,包含相关语言现象的数据集的可用性至关重要。然而,当涉及特定目标群体(例如青少年)时,由于同意和隐私限制等问题,收集此类数据可能存在问题。此外,尽管此类纯文本数据集已被广泛使用,但像 Instagram 这样基于图像的社交媒体平台所设置的限制,使得研究人员难以对多模态仇恨言论数据进行实验。因此,我们开发了 CREENDER,一个已在课堂中使用的标注工具,用于创建一个多模态的图像和侮辱性评论数据集,并在 Apache 2.0 许可下免费提供。该语料库包含意大利语评论,已从不同角度进行分析,以研究图像主题是否在触发评论方面发挥作用。我们发现,用户以不同方式评判相同的图像,尽管图片中人物的存在会增加收到攻击性评论的概率。

关键词

引用

@article{arxiv.2005.02235,
  title  = {Creating a Multimodal Dataset of Images and Text to Study Abusive Language},
  author = {Alessio Palmero Aprosio and Stefano Menini and Sara Tonelli},
  journal= {arXiv preprint arXiv:2005.02235},
  year   = {2020}
}