中文

HL 数据集:场景、动作与理由的视觉接地描述

计算与语言 2023-09-26 v3 计算机视觉与模式识别

摘要

当前的图像描述数据集聚焦于以物体为中心的描述,刻画图像中可见物体,例如“人们在公园里吃东西”。尽管这些数据集有助于评估视觉与语言模型识别和描述视觉内容的能力,它们不支持涉及以更高层次描述进行测试或微调的受控实验,而此类描述对人类而言轻松且自然。例如,人们常基于图像所描绘的场景类型(“度假村中的人们”)及其所执行动作(“人们野餐”)来描述图像。此类描述依托个人经验与常识假设。我们提出 High-Level 数据集,其扩展自 COCO 数据集的 14997 张图像,并对齐一组沿三个轴收集的新的人类标注(高层)描述:场景、动作与理由,共计 134,973 条。我们进一步以独立读者集收集的置信度分数,以及通过组合三个轴之一合成生成的叙述性描述集对该数据集进行扩展。我们描述并深入分析该数据集,同时给出高层描述任务的基线结果。

关键词

引用

@article{arxiv.2302.12189,
  title  = {HL Dataset: Visually-grounded Description of Scenes, Actions and Rationales},
  author = {Michele Cafagna and Kees van Deemter and Albert Gatt},
  journal= {arXiv preprint arXiv:2302.12189},
  year   = {2023}
}