评估开源视觉语言模型用于多模态讽刺检测
机器学习
2025-10-15 v1
摘要
最新进展在开源视觉语言模型(VLMs)为理解复杂且主观的多模态现象如讽刺提供了新机会。在本工作中,我们在零-shot、one-shot 和 few-shot 提示下评估了七种最先进的 VLMs——BLIP2、InstructBLIP、OpenFlamingo、LLaVA、PaliGemma、Gemma3 和 Qwen-VL——其检测多模态讽刺的能力。此外,我们评估了模型在生成解释以讽刺实例为例的能力。我们在三个基准讽刺数据集(Muse、MMSD2.0 和 SarcNet)上评估了 VLMs 的能力。我们的主要目标有两个:(1)量化每个模型在检测讽刺图像-文本对方面的性能;(2)评估其生成高质量解释的能力,这些解释突出了驱动讽刺的视觉-文本不一致性。我们的结果表明,虽然当前模型在二进制讽刺检测方面取得中等成果,但在没有特定任务微调的情况下仍无法生成高质量的解释。
引用
@article{arxiv.2510.11852,
title = {Evaluating Open-Source Vision-Language Models for Multimodal Sarcasm Detection},
author = {Saroj Basnet and Shafkat Farabi and Tharindu Ranasinghe and Diptesh Kanoji and Marcos Zampieri},
journal= {arXiv preprint arXiv:2510.11852},
year = {2025}
}
备注
Accepted to ICDMW 2025 Workshop on Multimodal AI (MMAI). Full workshop info: https://icdmw25mmai.github.io/