夏洛克·福尔摩斯的溯因:一个视觉溯因推理数据集
计算机视觉与模式识别
2022-07-26 v2 计算与语言
摘要
人类具有非凡的溯因推理能力,能够推测图像字面内容之外的信息。通过识别散布在场景中的具体视觉线索,我们几乎不由自主地基于日常经验和对世界的知识,得出超越字面场景的可能推断。例如,如果我们看到路边有一个“20 mph”的标志,我们可能会推断这条街位于居民区(而非高速公路),即使图中没有房屋。机器能否执行类似的视觉推理?我们提出了 Sherlock,一个包含 103K 张图像的标注语料库,用于测试机器超越图像字面内容进行溯因推理的能力。我们采用自由观看范式:参与者首先观察并识别图像中的显著线索(例如物体、动作),然后根据该线索提供关于场景的合理推断。我们总共收集了 363K 对(线索,推断),形成了首个此类视觉溯因推理数据集。利用我们的语料库,我们测试了溯因推理的三个互补维度。我们评估模型的能力:i) 从大型候选语料库中检索相关推断;ii) 通过边界框定位推断的证据;iii) 比较合理推断,以匹配在一个新收集的包含 19K 条李克特量表判断的诊断语料库上的人类判断。虽然我们发现使用多任务目标微调 CLIP-RN50x64 优于强基线,但模型性能与人类一致性之间仍存在显著差距。数据、模型和排行榜可在 http://visualabduction.com/ 获取。
引用
@article{arxiv.2202.04800,
title = {The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning},
author = {Jack Hessel and Jena D. Hwang and Jae Sung Park and Rowan Zellers and Chandra Bhagavatula and Anna Rohrbach and Kate Saenko and Yejin Choi},
journal= {arXiv preprint arXiv:2202.04800},
year = {2022}
}
备注
code, data, models at http://visualabduction.com/