中文

面向讽刺理解能力的高质量标注多模态数据集——YesBut

计算机视觉与模式识别 2024-09-23 v1 人工智能 计算与语言

摘要

即使是当前的视觉语言模型,也对理解讽刺和幽默感到困惑。在本文中,我们提出了讽刺图像检测(确定图像是否为讽刺图像)、理解(生成图像为何为讽刺的原因)和完成(给定图像的一半,从两个给定选项中选择另一半,使得完整图像为讽刺)等具有挑战性的任务,并发布了一个高质量的数据集 YesBut,包含 2547 张图片,其中 1084 张为讽刺图像,1463 张为非讽刺图像,包含不同的艺术风格。每个讽刺图像都描绘了一个正常情景,同时包含一个令人捧腹或讽刺的冲突情景。尽管当前视觉语言模型在诸如视觉问答和图像描述生成等多模态任务上取得了成功,但我们的基准实验表明,在零样本设置下,这些模型在 YesBut 数据集上的所提出任务上表现较差,无论是自动评估还是人类评估都如此。此外,我们还发布了一个包含 119 张真实讽刺摄影作品的数据集供进一步研究。数据集和代码均可在 https://github.com/abhi1nandy2/yesbut_dataset 获取。

关键词

引用

@article{arxiv.2409.13592,
  title  = {YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models},
  author = {Abhilash Nandy and Yash Agarwal and Ashish Patwa and Millon Madhur Das and Aman Bansal and Ankit Raj and Pawan Goyal and Niloy Ganguly},
  journal= {arXiv preprint arXiv:2409.13592},
  year   = {2024}
}

备注

EMNLP 2024 Main (Long), 18 pages, 14 figures, 12 tables