将人眼注视整合入注意力机制以用于第一人称活动识别
计算机视觉与模式识别
2020-11-10 v1
摘要
众所周知,人眼注视携带关于视觉注意的重要信息。然而,在深度神经网络的注意力机制中融入注视数据存在三个主要困难:1) 由于眨眼和快速眼动,注视 fixation 点可能存在测量误差;2) 何时以及注视数据与视觉注意的相关程度均不明确;3) 在许多现实场景中注视数据并非总可获得。在本工作中,我们引入一种有效的概率方法,将人眼注视整合入时空注意力中以用于第一人称活动识别。具体而言,我们将注视 fixation 点的位置表示为结构化离散潜变量以建模其不确定性。此外,我们使用变分方法对注视 fixation 的分布进行建模。注视分布在训练过程中学习,因此在测试时不再需要注视位置的真实标注,因为它们可由学习到的注视分布预测得到。预测的注视位置被用于提供信息性注意线索以提升识别性能。我们的方法在EGTEA(一个提供注视测量的大规模第一人称活动识别数据集)上优于所有以往的SOTA方法。我们还进行了消融研究和定性分析以证明我们的注意力机制是有效的。
引用
@article{arxiv.2011.03920,
title = {Integrating Human Gaze into Attention for Egocentric Activity Recognition},
author = {Kyle Min and Jason J. Corso},
journal= {arXiv preprint arXiv:2011.03920},
year = {2020}
}
备注
WACV 2021 camera ready (Supplementary material: on CVF soon)