注意力即我们所需:锁定以对象为中心的注意力用于第一人称活动识别
计算机视觉与模式识别
2018-08-01 v1
摘要
本文提出一种端到端可训练的深层神经网络模型,用于第一人称活动识别。我们的模型基于如下观察:第一人称活动高度由视频中的对象及其位置所刻画。基于此,我们开发了一种空间注意力机制,使网络能够关注包含与所考虑活动相关对象的区域。我们利用为通用图像识别预训练的CNN的类特定激活,为每帧学习高度专门的注意力图,并将其用于通过卷积LSTM对视频进行时空编码。我们的模型在弱监督设定下使用原始视频级活动类别标签进行训练。尽管如此,在标准第一人称活动基准上,我们的模型比当前最佳方法在识别准确率上高出至多+6%个百分点,而该方法在训练中利用了手部分割与对象位置的强监督。我们可视化分析了网络生成的注意力图,揭示网络成功识别了视频帧中的相关对象,这或可解释其强劲的识别性能。我们还讨论了关于设计选择的详尽消融分析。
引用
@article{arxiv.1807.11794,
title = {Attention is All We Need: Nailing Down Object-centric Attention for Egocentric Activity Recognition},
author = {Swathikiran Sudhakaran and Oswald Lanz},
journal= {arXiv preprint arXiv:1807.11794},
year = {2018}
}
备注
Accepted to BMVC 2018