中文

图像之外的推理有其时地

计算机视觉与模式识别 2022-03-29 v2 人工智能

摘要

图像对人眼而言往往比像素本身更具意义,因为我们可以从其他来源推断、关联和推理上下文信息,以建立更完整的图景。例如,在图 1 中,我们可以通过对标志、建筑、人群等的分段理解,找到识别与图片相关的新闻文章的方法。这种推理可以提供图像拍摄的时间和地点,这将有助于我们完成后续任务,例如自动故事情节构建、意图效果照片中图像来源的校正,以及上游处理,如针对特定位置或时间的图像聚类。在这项工作中,我们形式化了这个问题并引入了 TARA:一个包含 16k 张图像及其关联新闻、时间和地点的数据集,该数据集从《纽约时报》自动提取,并包含来自 WIT 的额外 61k 个示例作为远程监督。在这些提取的基础上,我们提供了一个众包子集,我们相信在其中可以找到图像的时空信息以用于评估目的。我们表明,最先进的联合模型与人类表现之间存在 70% 的差距,而我们提出的使用分段推理的模型略微填补了这一差距,这激励了能够利用世界知识进行开放式推理的更高层次视觉-语言联合模型。数据和代码已在 https://github.com/zeyofu/TARA 公开。

关键词

引用

@article{arxiv.2203.00758,
  title  = {There is a Time and Place for Reasoning Beyond the Image},
  author = {Xingyu Fu and Ben Zhou and Ishaan Preetam Chandratreya and Carl Vondrick and Dan Roth},
  journal= {arXiv preprint arXiv:2203.00758},
  year   = {2022}
}

备注

Article accepted to the ACL 2022 Main conference