Pro-Cap:利用冻结视觉语言模型进行仇恨表情包检测
计算机视觉与模式识别
2023-08-17 v1 信息检索
多媒体
摘要
仇恨表情包检测是一项具有挑战性的多模态任务,需要同时理解视觉与语言以及跨模态交互。近期研究尝试为此任务微调预训练视觉语言模型(PVLMs)。然而,随着模型规模增大,更高效地利用强大的 PVLMs 而非简单微调变得十分重要。最近,研究者尝试将表情包图像转换为文本描述并提示语言模型进行预测。该方法表现良好,但受限于信息量不足的图像描述。考虑到上述两点,我们提出一种基于探针的描述生成方法,以零样本视觉问答(VQA)方式利用 PVLMs。具体而言,我们通过提出与仇恨内容相关的问题来提示冻结的 PVLM,并将答案用作图像描述(称之为 Pro-Cap),从而使描述包含仇恨内容检测的关键信息。在三个基准上,采用 Pro-Cap 的模型所取得的良好性能验证了所提方法的有效性与泛化能力。
引用
@article{arxiv.2308.08088,
title = {Pro-Cap: Leveraging a Frozen Vision-Language Model for Hateful Meme Detection},
author = {Rui Cao and Ming Shan Hee and Adriel Kuek and Wen-Haw Chong and Roy Ka-Wei Lee and Jing Jiang},
journal= {arXiv preprint arXiv:2308.08088},
year = {2023}
}
备注
Camera-ready for 23, ACM MM