文本还是图像?什么对仇恨模因检测模型的跨域泛化能力更重要?
计算与语言
2024-02-08 v1 人工智能
计算机视觉与模式识别
摘要
本文深入探讨了多模态仇恨模因检测中跨域泛化的严峻挑战,并提出了令人信服的发现。我们提供了充分的证据支持以下假设:只有仇恨模因的文本成分能使现有的多模态分类器在不同域之间进行泛化,而图像成分对特定训练数据集高度敏感。证据包括演示表明,仇恨文本分类器在零样本设置下的表现与仇恨模因分类器相似。同时,将由模因图像生成的标题引入仇恨模因分类器会使平均 F1 分数降低 0.02。通过黑盒解释,我们确定了文本模态的重大贡献(平均 83%),而随着模因图像标题的引入,这一贡献降至 52%。此外,我们在一个新创建的混淆因子数据集上的评估显示,文本混淆因子的性能高于图像混淆因子,平均 F1 为 0.18。
引用
@article{arxiv.2402.04967,
title = {Text or Image? What is More Important in Cross-Domain Generalization Capabilities of Hate Meme Detection Models?},
author = {Piush Aggarwal and Jawar Mehrabanian and Weigang Huang and Özge Alacam and Torsten Zesch},
journal= {arXiv preprint arXiv:2402.04967},
year = {2024}
}
备注
Accepted at EACL'2024 Findings