中文

大型视觉语言模型是否能理解多模态讽刺

计算与语言 2025-08-06 v1 计算机视觉与模式识别

摘要

讽刺是一种复杂的语言现象,涉及字面意义与实际意图之间的差异,这使得情感分析和其他情感敏感任务变得具有挑战性。虽然传统的讽刺检测方法主要关注文本,但最近的一些方法已融入了多模态信息。然而,大型视觉语言模型(LVLMs)在多模态讽刺分析(MSA)中的应用仍属探索性。本文评估了 LVLMs 在 MSA 任务中的表现,具体关注多模态讽刺检测与多模态讽刺解释。通过进行全面实验,我们识别出了关键限制,例如视觉理解不足以及缺乏概念知识。为解决这些问题,我们提出一种无需训练的框架,集成深入的对象提取和外部概念知识,以提高模型在多模态上下文中解释和解释讽刺的能力。实验结果在多个模型上显示,我们提出的框架有效。代码已公开于 https://github.com/cp-cp/LVLM-MSA。

关键词

引用

@article{arxiv.2508.03654,
  title  = {Can Large Vision-Language Models Understand Multimodal Sarcasm?},
  author = {Xinyu Wang and Yue Zhang and Liqiang Jing},
  journal= {arXiv preprint arXiv:2508.03654},
  year   = {2025}
}

备注

Accepted by CIKM 2025