中文

我在搜寻什么:视觉搜索中目标身份的零样本推断

计算机视觉与模式识别 2020-06-01 v2 人工智能 机器学习

摘要

我们能否从人的动作推断其意图?作为一个示例问题,此处我们考虑如何通过解码人的眼动行为来破译其正在搜寻的目标。我们进行了两项心理物理学实验,在受试者搜索目标物体时监测其眼动。我们将落在非目标物体上的注视点定义为“错误注视点”。利用这些错误注视点,我们开发了用于推断目标身份的模型(InferNet)。InferNet 使用预训练的卷积神经网络从错误注视点提取特征,并计算错误注视点与搜索图像中所有位置之间的相似性图。该模型跨层整合相似性图,并跨所有错误注视点融合这些图。InferNet 成功识别了受试者的目标,且即使未在推断任务上做任何物体特定训练,也优于具有竞争力的零模型。

关键词

引用

@article{arxiv.2005.12741,
  title  = {What am I Searching for: Zero-shot Target Identity Inference in Visual Search},
  author = {Mengmi Zhang and Gabriel Kreiman},
  journal= {arXiv preprint arXiv:2005.12741},
  year   = {2020}
}

备注

this was a mistaken new submission and a pointer to arXiv:1807.11926