MemeReaCon:探测大型视觉语言模型中语境依赖性 meme 理解
人工智能
2025-06-05 v2
摘要
meme 作为一种多模态在线交际形式日益流行,其解释高度依赖其出现的具体语境。当前方法主要关注孤立 meme 分析,要么用于有害内容检测,要么用于独立解释,忽视了关键挑战:同一 meme 根据其对话语境可能表达不同意图。这一忽视导致评估鸿沟:尽管人类直观认识到语境如何塑造 meme 解释,但大型视觉语言模型 (LVLMs) 几乎无法理解语境依赖性的 meme 意图。为缓解此关键局限,我们引入 MemeReaCon,一个专为评估 LVLMs 在其原始语境中理解 meme 而设计的新型基准测试。我们收集来自五个不同 Reddit 社区的 meme,保留每张 meme 的图片、帖子文本及用户评论。我们仔细标注 meme 如何与文本协同工作、作者的意图、 meme 的结构以及社区的反应。我们的测试表明,领先的 LVLMs 存在明显弱点:模型要么未能解释上下文中的关键信息,要么过于关注视觉细节而忽略交际目的。因此,MemeReaCon 既是揭示当前局限的诊断工具,也是推动更高级语境理解能力 LVLMs 开发的具挑战性基准测试。
引用
@article{arxiv.2505.17433,
title = {MemeReaCon: Probing Contextual Meme Understanding in Large Vision-Language Models},
author = {Zhengyi Zhao and Shubo Zhang and Yuxi Zhang and Yanxi Zhao and Yifan Zhang and Zezhong Wang and Huimin Wang and Yutian Zhao and Bin Liang and Yefeng Zheng and Binyang Li and Kam-Fai Wong and Xian Wu},
journal= {arXiv preprint arXiv:2505.17433},
year = {2025}
}