用于视频动作识别的自顶向下注意力循环 VLAD 编码
计算机视觉与模式识别
2018-08-30 v1
摘要
多数近期从视频进行动作识别的方法利用深度架构将视频片段编码为固定长度表示向量,再用于分类。为此成功,网络必须能够抑制无关场景背景,并从视频中最具判别力的部分提取表示。我们的贡献基于如下观察:表征视频中动作的时空模式与物体及其在视频中的位置高度相关。我们提出 Top-down Attention Action VLAD(TA-VLAD),一种内置空间注意力的深度循环架构,其对视频进行时间聚合的 VLAD 编码以实现动作识别。我们采用自顶向下的注意力方法,利用从为图像分类预训练的深度 CNN 获得的类特定激活图,在使用门控循环单元将外观特征编码为固定长度视频描述符之前对其加权。我们的方法在 HMDB51 与 UCF101 基准上取得了当前最优的识别准确率。
引用
@article{arxiv.1808.09892,
title = {Top-down Attention Recurrent VLAD Encoding for Action Recognition in Videos},
author = {Swathikiran Sudhakaran and Oswald Lanz},
journal= {arXiv preprint arXiv:1808.09892},
year = {2018}
}
备注
Accepted to the 17th International Conference of the Italian Association for Artificial Intelligence