中文

基于视觉语言模型的多模态讽刺内容检测与缓解

计算机视觉与模式识别 2025-05-02 v1 人工智能 计算与语言

摘要

社交媒体的快速演进为个体提供了增强的在线内容创作渠道,使他们能够表达思想与意见。多模态讽刺内容常被用于以玩乐或幽默方式表达,同时融合视觉与文本元素,有时被滥用用于散布针对个体或群体的仇恨言论。虽然讽刺内容的检测研究众多,但如何有效转化讽刺内容中的有害信息仍是一大挑战。利用视觉语言模型(VLM)的强大生成与推理能力,我们针对讽刺内容的检测与缓解任务展开工作。本文的两个关键贡献:首先,提出一种定义导向的提示技术用于检测讽刺内容;其次,构建一种统一的缓解讽刺内容框架,命名为 UnHateMeme, 通过替换讽刺的文本和/或视觉组件来实现内容转化。借助定义导向的提示,VLM 在讽刺内容检测任务中取得优异性能。此外,我们的 UnHateMeme 框架结合 VLM,展现出将讽刺内容转化为符合人类水平讽刺标准且保持多模态一致性的非讽刺形式的强大能力。通过实验,我们展示了 LLaVA、Gemini 和 GPT-4o 等最新预训练 VLM 在所提任务中的有效性,并对其在这些任务中的优势与局限性进行了全面分析。本文旨在为确保安全尊重的在线环境提供 VLM 的重要应用案例。

关键词

引用

@article{arxiv.2505.00150,
  title  = {Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models},
  author = {Minh-Hao Van and Xintao Wu},
  journal= {arXiv preprint arXiv:2505.00150},
  year   = {2025}
}