中文

OxfordTVG-HIC:机器能否从图像生成幽默描述?

计算机视觉与模式识别 2023-07-24 v1 计算与语言

摘要

本文提出 OxfordTVG-HIC(幽默图像描述,Humorous Image Captions),一个用于幽默生成与理解的大规模数据集。幽默是一种抽象的、主观的、依赖语境的认知建构,涉及多种认知因素,这使其生成与解读成为一项具有挑战性的任务。因此,幽默生成与理解可作为一种新任务,用于评估深度学习方法处理抽象与主观信息的能力。由于数据稀缺,诸如图像描述等幽默相关的生成任务仍鲜有探索。为弥补这一空白,OxfordTVG-HIC 提供了约 2.9M 带有幽默分数的图像-文本对,用于训练可泛化的幽默描述模型。与现有描述数据集不同,OxfordTVG-HIC 具有广泛的情感与语义多样性,由此产生尤其利于生成幽默的脱离语境样本。此外,OxfordTVG-HIC 的整理不含冒犯性内容。我们还展示了如何利用 OxfordTVG-HIC 评估生成文本的幽默程度。通过对训练模型的可解释性分析,我们识别出对引发幽默预测(与生成)有影响的视觉与语言线索。我们定性地观察到,这些线索与认知心理学中的良性违背理论相一致。

关键词

引用

@article{arxiv.2307.11636,
  title  = {OxfordTVG-HIC: Can Machine Make Humorous Captions from Images?},
  author = {Runjia Li and Shuyang Sun and Mohamed Elhoseiny and Philip Torr},
  journal= {arXiv preprint arXiv:2307.11636},
  year   = {2023}
}

备注

Accepted by ICCV 2023