中文

MemeCap:一个用于模因描述与解读的数据集

计算与语言 2023-05-24 v1

摘要

模因是网络用户广泛使用的一种借助视觉隐喻表达想法的工具。理解模因需要结合模因内部或周围的文本,识别并解读视觉隐喻,且常需运用背景知识与推理能力。我们提出了模因描述任务,并发布了一个新数据集 MemeCap。该数据集包含 6.3K 个模因,以及含有该模因的帖子标题、模因描述文本、字面图像描述和视觉隐喻。尽管视觉语言(VL)模型在图像描述和视觉问答等任务上近期取得了成功,我们使用最先进 VL 模型开展的广泛实验表明,它们仍难以处理视觉隐喻,且表现远逊于人类。

关键词

引用

@article{arxiv.2305.13703,
  title  = {MemeCap: A Dataset for Captioning and Interpreting Memes},
  author = {EunJeong Hwang and Vered Shwartz},
  journal= {arXiv preprint arXiv:2305.13703},
  year   = {2023}
}