掀盖游戏:上下文推理中的什么、何处与何时
计算机视觉与模式识别
2019-09-26 v2 人工智能
摘要
上下文推理在广泛应用中至关重要,这些应用需要根据以往经验和知识来解释当前输入。在空间和时间上下文信息在视觉识别领域中都起着关键作用。在此,我们研究用于视觉识别的空间约束(哪些图像特征提供上下文信息以及它们位于何处)和时间约束(不同的上下文线索在何时起作用)。该任务是推理场景上下文并推断在自然图像中藏在盖板后面的目标物体是什么。为解决这个问题,我们首先描述了一项在线人类心理物理实验,记录掀盖游戏中通过鼠标点击进行的主动采样,并识别出对高上下文推理精度具有诊断性的点击模式和特征。作为这些点击模式和视觉特征有用性的证明,我们扩展了一个最先进的循环模型,该模型能够关注显著的上下文区域、动态整合有用信息、进行推断,并在多次点击中预测目标物体的类别标签。所提出的模型达到了人类水平的上下文推理精度,具有类人的采样行为,并学习了可解释的上下文推理特征。
引用
@article{arxiv.1902.00163,
title = {Lift-the-flap: what, where and when for context reasoning},
author = {Mengmi Zhang and Claire Tseng and Karla Montejo and Joseph Kwon and Gabriel Kreiman},
journal= {arXiv preprint arXiv:1902.00163},
year = {2019}
}