视觉搜索中零样本目标身份推断:我在搜寻什么
计算机视觉与模式识别
2020-06-03 v2 人工智能
摘要
我们能否从人的动作推断其意图?作为一个示例问题,本文考虑如何通过解码眼动行为来破译一个人正在搜寻的目标。我们开展了两项心理物理学实验,在受试者搜索目标物体时监测其眼动。我们将落在非目标物体上的注视点定义为“错误注视”。利用这些错误注视,我们开发了模型(InferNet)来推断目标为何。InferNet 使用预训练的卷积神经网络从错误注视中提取特征,并计算错误注视与搜索图像中所有位置之间的相似度图。该模型跨层整合相似度图,并在所有错误注视上融合这些图。InferNet 成功识别受试者目标,且无需在推断任务上做任何物体特定训练即优于竞争性零模型。
引用
@article{arxiv.1807.11926,
title = {What am I Searching for: Zero-shot Target Identity Inference in Visual Search},
author = {Mengmi Zhang and Gabriel Kreiman},
journal= {arXiv preprint arXiv:1807.11926},
year = {2020}
}
备注
Accepted for presentation at EPIC@CVPR2020 workshop