中文

Multi3Hate:基于视觉语言模型的多模态、多语言与多文化仇恨言论检测

计算与语言 2025-02-18 v2

摘要

警告:本文包含可能引起冒犯或不适的内容。全球平台上的仇恨言论审核因其内容的多模态和多语言特性以及文化感知的差异而面临独特挑战。现有的视觉语言模型(VLM)如何在细微差别中导航?为研究这一问题,我们创建了首个多模态多语言平行仇恨言论数据集 Multi3Hate,由多元文化标注者团队标注,包含跨越 5 种语言(英语、德语、西班牙语、印地语和普通话)的 300 个平行表情包样本。我们证明文化背景显著影响多模态仇恨言论标注。各国之间的平均成对一致性仅为 74%,远低于随机标注者组的一致性。我们的定性分析表明,最低成对标签一致性——美国与印度之间仅 67%——可归因于文化因素。随后我们对 5 个大型 VLM 进行了零样本实验,发现这些模型更倾向于与美国标注者保持一致,而非其他文化的标注者,即使表情包和提示语以其他文化的主导语言呈现。代码和数据集已发布于 https://github.com/MinhDucBui/Multi3Hate。

关键词

引用

@article{arxiv.2411.03888,
  title  = {Multi3Hate: Multimodal, Multilingual, and Multicultural Hate Speech Detection with Vision-Language Models},
  author = {Minh Duc Bui and Katharina von der Wense and Anne Lauscher},
  journal= {arXiv preprint arXiv:2411.03888},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Main (Camera-Ready Version)