信不信由你,我们知道你在看什么!
计算机视觉与模式识别
2019-07-05 v1
摘要
通过借鉴人类在视线跟随中的智慧,我们提出了一种两阶段方案,用于预测场景中目标人物的注视点。具体而言,在第一阶段,将头部图像及其位置输入视线方向通路以预测视线方向,随后生成多尺度视线方向场,在不考虑场景内容的情况下刻画注视点的分布。在第二阶段,将多尺度视线方向场与图像内容拼接,并输入热力图通路进行热力图回归。我们基于两阶段方案的视线跟随具有两个优点:i)我们的方案模仿人类在视线跟随中的行为,因此更具心理学合理性;ii)除使用热力图监督网络输出外,我们还可利用视线方向辅助视线方向通路的训练,从而使网络训练更鲁棒。考虑到现有视线跟随数据集由第三人称标注,我们构建了一个视频视线跟随数据集,其真值由视频中的观察者标注,因此更为可靠。基于该数据集的评估能更好地反映不同方法在真实场景中的能力。在两个数据集上的大量实验表明,我们的方法显著优于现有方法,验证了我们所提视线跟随方案的有效性。我们的数据集与代码发布于 https://github.com/svip-lab/GazeFollowing。
引用
@article{arxiv.1907.02364,
title = {Believe It or Not, We Know What You Are Looking at!},
author = {Dongze Lian and Zehao Yu and Shenghua Gao},
journal= {arXiv preprint arXiv:1907.02364},
year = {2019}
}
备注
ACCV2018