中文

Pro-Cap:利用冻结视觉语言模型进行仇恨表情包检测

计算机视觉与模式识别 2023-08-17 v1 信息检索 多媒体

摘要

仇恨表情包检测是一项具有挑战性的多模态任务,需要同时理解视觉与语言以及跨模态交互。近期研究尝试为此任务微调预训练视觉语言模型(PVLMs)。然而,随着模型规模增大,更高效地利用强大的 PVLMs 而非简单微调变得十分重要。最近,研究者尝试将表情包图像转换为文本描述并提示语言模型进行预测。该方法表现良好,但受限于信息量不足的图像描述。考虑到上述两点,我们提出一种基于探针的描述生成方法,以零样本视觉问答(VQA)方式利用 PVLMs。具体而言,我们通过提出与仇恨内容相关的问题来提示冻结的 PVLM,并将答案用作图像描述(称之为 Pro-Cap),从而使描述包含仇恨内容检测的关键信息。在三个基准上,采用 Pro-Cap 的模型所取得的良好性能验证了所提方法的有效性与泛化能力。

关键词

引用

@article{arxiv.2308.08088,
  title  = {Pro-Cap: Leveraging a Frozen Vision-Language Model for Hateful Meme Detection},
  author = {Rui Cao and Ming Shan Hee and Adriel Kuek and Wen-Haw Chong and Roy Ka-Wei Lee and Jing Jiang},
  journal= {arXiv preprint arXiv:2308.08088},
  year   = {2023}
}

备注

Camera-ready for 23, ACM MM