一种用于对象级人类注意力估计的自验证网络
计算机视觉与模式识别
2019-12-17 v2
摘要
由于人类视觉系统的中央凹特性,人们一次只能将视觉注意力集中在视野的一小块区域上,该区域通常仅包含单个对象。在第一人称(自我中心)视频中估计此注意对象,对于许多以人为中心的现实应用(如增强现实应用和驾驶辅助系统)十分有用。该问题的一个直接解决方案是选取边界框被注视点命中的对象,其中眼动注视点估计由传统眼动注视估计器获得,对象候选由现成的对象检测器生成。然而,这种方法可能失败,因为它将“何处”和“何物”问题分开处理,尽管它们是高度相关、互为因果的问题。在本文中,我们提出一种新颖的统一模型,该模型在识别并定位第一人称视频中受关注对象时同时利用空间和时间证据。它引入了一种新颖的自验证模块(Self Validation Module),该模块强制并利用“何处”与“何物”概念的一致性。我们在两个公开数据集上进行了评估,表明自验证模块显著有益于训练和测试,且我们的模型优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.1910.14260,
title = {A Self Validation Network for Object-Level Human Attention Estimation},
author = {Zehua Zhang and Chen Yu and David Crandall},
journal= {arXiv preprint arXiv:1910.14260},
year = {2019}
}
备注
Accepted by NeurIPS 2019