基于复合自注意力双流框架的未裁剪视频动作识别
计算机视觉与模式识别
2020-04-24 v2
摘要
随着深度学习算法的快速发展,视频中的动作识别已取得诸多重要研究成果。动作识别中的一个问题——零样本动作识别(ZSAR)——近来备受关注,其在无任何正例的情况下对新类别进行分类。动作识别的另一难点是未裁剪数据可能严重影响模型性能。我们提出一种带有预训练模型的复合双流框架。我们所提框架包括一个分类器分支和一个复合特征分支。两个分支中均采用图网络模型,有效提升了框架的特征提取与推理能力。在复合特征分支中,构建 3 通道自注意力模型以对视频中每帧加权,并更多关注关键帧。每个自注意力模型通道输出一组注意力权重以聚焦于视频的特定方面,一组注意力权重对应一个一维向量。3 通道自注意力模型能从多方面评估关键帧,输出的注意力权重向量集合构成注意力矩阵,有效增强了对动作强相关关键帧的注意力。该模型可在零样本条件下实现动作识别,并对未裁剪视频数据具有良好识别性能。相关数据集上的实验结果证实了模型的有效性。
引用
@article{arxiv.1908.04353,
title = {Action Recognition in Untrimmed Videos with Composite Self-Attention Two-Stream Framework},
author = {Dong Cao and Lisha Xu and HaiBo Chen},
journal= {arXiv preprint arXiv:1908.04353},
year = {2020}
}
备注
Accepted to ACPR 2019