中文

当计算机视觉凝视认知时

人工智能 2014-12-09 v1 计算机视觉与模式识别

摘要

联合注意是一种核心的、早期发展起来的社会交互形式。它基于我们辨别他人正在注视的第三方物体的能力。尽管已有研究表明,人们能够准确判断另一个人是在直视自己还是看向别处,但人类辨别第三方注视远处物体的能力却鲜为人知,尤其是在观察者可以自由移动头部和眼睛的无约束情况下。在本文中,我们通过共同探索人类心理物理学与一种受认知启发的计算机视觉模型来解决这一问题,该模型能够从二维人脸图像中检测三维注视方向。行为研究与计算机视觉的结合产生了几个有趣的发现:(1)在自由注视任务中,人类区分相隔 8deg10deg8{\deg}-10{\deg} 视角目标的准确率约为 40%;(2)解读不同观察者注视的能力差异巨大;(3)这种差异可以被计算模型所捕捉;(4)人类的表现显著优于当前模型。这些结果共同表明,鉴于自然注视任务的计算挑战性,人类联合注意的敏锐度确实令人惊叹。此外,人类与模型表现之间的差距,以及不同观察者之间注视解读的变异性,要求我们进一步理解人类在应对这一挑战性任务时所使用的底层机制。

关键词

引用

@article{arxiv.1412.2672,
  title  = {When Computer Vision Gazes at Cognition},
  author = {Tao Gao and Daniel Harari and Joshua Tenenbaum and Shimon Ullman},
  journal= {arXiv preprint arXiv:1412.2672},
  year   = {2014}
}

备注

Tao Gao and Daniel Harari contributed equally to this work