中文

探索零样本视觉语言模型在仇恨表情包检测中的极限:漏洞及其解释

计算与语言 2025-03-25 v3 计算机视觉与模式识别 机器学习

摘要

当前社交媒体平台上多媒体内容使用的快速增长。其中一种高度流行的多媒体形式是表情包。虽然表情包主要用于促进有趣和积极的讨论,但恶意用户会利用表情包针对个人或易受攻击的社区进行攻击,这使得识别和解决此类仇恨表情包的任务刻不容缓。因此,社交媒体平台迫切需要对此类有害内容进行有效监管。由于内容规模巨大,手动监管极其困难,而自动化监管则受限于需要高质量的标注数据来训练仇恨表情包检测算法。这为探索现代视觉语言模型(VLM)的潜力提供了绝佳机会,这些模型在 various 任务中展现了卓越的性能。本文研究了在完全零样本设置下,VLMs 处理此类复杂任务(如仇恨表情包检测)的有效性,以此消除对该任务标注数据的依赖。我们进行了彻底的提示工程,并使用各种提示类型查询最先进的 VLMs 以检测仇恨/有害表情包。我们进一步采用一种新颖的基于超像素的遮蔽方法来解释误分类案例。最后我们表明,这些误分类可以清晰地归类为若干错误类型,了解这些错误类型应有助于未来设计更好的安全防护措施。

关键词

引用

@article{arxiv.2402.12198,
  title  = {Exploring the Limits of Zero Shot Vision Language Models for Hate Meme Detection: The Vulnerabilities and their Interpretations},
  author = {Naquee Rizwan and Paramananda Bhaskar and Mithun Das and Swadhin Satyaprakash Majhi and Punyajoy Saha and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2402.12198},
  year   = {2025}
}