基于人类眼睛注视的视觉搜索目标视觉解码
计算机视觉与模式识别
2017-06-22 v3 人机交互
摘要
人类注视揭示了用户的意图,这些意图可以在多大程度上被推断甚至可视化?注视被提出作为预测视觉搜索目标的隐式信息源,最近还被用于预测搜索目标的对象类别和属性。在这项工作中,我们更进一步,研究了将使用深度卷积神经网络编码人类注视信息的最新进展与生成图像模型的能力相结合,以视觉解码(即创建视觉表征)搜索目标的可行性。这种视觉解码具有挑战性,原因有二:1)搜索目标仅作为主观视觉模式存在于用户的脑海中,并且大多数情况下甚至无法被该人用语言描述;2)迄今为止,注视是否包含足够的信息来完成此任务尚不清楚。我们首次表明,搜索目标的视觉表征确实可以仅从人类注视中解码出来。我们提议首先将注视编码为语义表征,然后将该表征解码为图像。我们在一个包含14名参与者在图像拼贴中搜索服装的近期注视数据集上评估了我们的方法,并使用两项人类研究验证了模型的预测。我们的结果表明,62%(机会水平 = 10%)的情况下用户能够正确选择解码图像的类别。在我们的第二项研究中,我们展示了局部注视编码对于解码用户视觉搜索目标的重要性。
引用
@article{arxiv.1706.05993,
title = {Visual Decoding of Targets During Visual Search From Human Eye Fixations},
author = {Hosnieh Sattar and Mario Fritz and Andreas Bulling},
journal= {arXiv preprint arXiv:1706.05993},
year = {2017}
}