通过人类注视数据监督视频字幕生成的神经注意力模型
计算机视觉与模式识别
2017-07-20 v1
摘要
深度神经网络中的注意力机制受到人类注意力的启发,人类注意力随时间顺序聚焦于信息中最相关的部分以生成预测输出。这些模型中的注意力参数是以端到端方式隐式训练的,然而鲜有尝试显式地结合人类注视跟踪来监督注意力模型。本文中,我们研究注意力模型是否可以从显式人类注视标签中获益,特别是针对视频字幕生成任务。我们收集了一个名为 VAS 的新数据集,包含电影片段、相应的多句描述以及人类注视跟踪数据。我们提出了一种称为注视编码注意力网络(Gaze Encoding Attention Network, GEAN)的视频字幕模型,该模型可利用注视跟踪信息为句子生成提供空间和时间注意力。通过语言相似性度量的评估以及通过 Amazon Mechanical Turk 进行的人工评估,我们证明由人类注视数据引导的空间注意力确实提升了多种字幕生成方法的性能。此外,我们表明所提出的方法不仅在 VAS 数据集上,而且也在标准数据集(例如 LSMDC 和 Hollywood2)上,在注视预测和视频字幕生成方面均达到了最先进的(state-of-the-art)性能。
引用
@article{arxiv.1707.06029,
title = {Supervising Neural Attention Models for Video Captioning by Human Gaze Data},
author = {Youngjae Yu and Jongwook Choi and Yeonhwa Kim and Kyung Yoo and Sang-Hun Lee and Gunhee Kim},
journal= {arXiv preprint arXiv:1707.06029},
year = {2017}
}
备注
In CVPR 2017. 9 pages + supplementary 17 pages