中文

MemeMQA:基于依据推理的 meme 多模态问答

计算与语言 2024-05-21 v1 计算机与社会

摘要

meme 已演变为一种流行的多样化交流媒介,涵盖从幽默到宣传等多种用途。随着以图像为中心的内容日益流行,探索其潜在危害的不同方面已成为迫切需求。以往研究在封闭环境中分析 meme——检测危害、应用语义标签、提供自然语言解释。为拓展此类研究,本文引入 MemeMQA,一个多模态问答框架,旨�为结构化问题获取准确响应并提供连贯的解释。我们构建 MemeMQACorpus,一个新数据集,包含1,880个与1,122个 meme 相关的题目,配有相应的答案-解释配对。我们进一步提出 ARSENAL,一种新颖的两阶段多模态框架,利用大语言模型的推理能力来解决 MemeMQA。我们使用竞争性基线对 MemeMQA 进行基准测试,展示其优势——在衡量词汇和语义对齐的各种指标上相对于最佳基线实现约18%的答案预测准确率提升和差异化的文本生成。我们通过问题集多样化、关于 MemeMQA 通用性的 confounder-based 评估以及模态特定评估来分析 ARSENAL 的鲁棒性,从而加深对 meme 在多模态交流景观中的解释理解。

关键词

引用

@article{arxiv.2405.11215,
  title  = {MemeMQA: Multimodal Question Answering for Memes via Rationale-Based Inferencing},
  author = {Siddhant Agarwal and Shivam Sharma and Preslav Nakov and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2405.11215},
  year   = {2024}
}

备注

The paper has been accepted in ACL'24 (Findings)