中文

通过不同视角观察讽刺:分析大型视觉语言模型中的多模态讽刺感知

计算与语言 2025-11-04 v3 多媒体 社会与信息网络

摘要

随着大型视觉语言模型 (LVLMs) 显示出越来越接近人类的能力,一个关键问题浮出水面:不同的 LVLMs 是否以不同的方式解释多模态讽刺,是否可以像人类一样单一模型从多个视角把握讽刺?为此,我们引入了一个分析框架,使用在现有多模态讽刺数据集上设计的系统性提示符。我们评估了 12 个最先进的 LVLMs 在 2,409 个样本上的表现,检查了在不同模型和不同提示下的解释性差异,关注置信水平、与数据集标签的一致性以及对含糊“中性”案例的识别。我们还在一个多样化的 100 样本小基准上验证了我们的发现,该基准包含多个数据集、扩展的提示符变体以及代表性商业 LVLMs。我们的发现揭示了显著的差异——在不同 LVLMs 之间以及在同一模型在不同提示下。虽然以分类为导向的提示符会产生更高的内部一致性,但当被要求进行解释推理时,模型之间会明显发生分歧。这些结果通过凸显讽刺的主观性,挑战了二元标注范式。我们倡导超越僵化标注方案,走向多视角、不确定性感知建模,为多模态讽刺理解提供更深入的见解。我们的代码和数据可在 https://github.com/CoderChen01/LVLMSarcasmAnalysis 获取。

关键词

引用

@article{arxiv.2503.12149,
  title  = {Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models},
  author = {Junjie Chen and Xuyang Liu and Subin Huang and Linfeng Zhang and Hang Yu},
  journal= {arXiv preprint arXiv:2503.12149},
  year   = {2025}
}