基于3D CNN全局-局部注意力的弱监督动作定位与动作识别
计算机视觉与模式识别
2022-08-17 v3 人工智能
神经与进化计算
摘要
3D卷积神经网络(3D CNN)在视频序列等3D数据上捕捉空间与时间信息。然而,由于卷积与池化机制,信息损失似乎不可避免。为改进3D CNN中的视觉解释与分类,我们提出两种途径:i)利用训练好的3DResNext网络聚合逐层从全局到局部(全局-局部)的离散梯度;ii)实现注意力门控网络以提升动作识别的准确率。所提方法旨在通过视觉归因、弱监督动作定位与动作识别,展示3D CNN中称为全局-局部注意力的每一层的效用。首先,训练3DResNext并针对最大预测类别通过反向传播用于动作分类。随后对各层的梯度与激活进行上采样。之后使用聚合生成更细致的注意力,其指向预测类别输入视频中最关键的部分。我们对最终注意力进行轮廓阈值化以完成最终定位。我们利用通过3DCam的细粒度视觉解释,在裁剪视频中评估空间与时间动作定位。实验结果表明,所提方法产生信息丰富的视觉解释与判别性注意力。此外,通过各层注意力门控的动作识别比基线模型产生更好的分类结果。
引用
@article{arxiv.2012.09542,
title = {Weakly-Supervised Action Localization and Action Recognition using Global-Local Attention of 3D CNN},
author = {Novanto Yudistira and Muthu Subash Kavitha and Takio Kurita},
journal= {arXiv preprint arXiv:2012.09542},
year = {2022}
}