基于骨架的人体动作识别的自注意力网络
计算机视觉与模式识别
2019-12-19 v1
摘要
基于骨架的动作识别近来引起大量关注。研究者提出新方法来提取时空关系,并在大规模基于骨架的数据集上取得可观进展。大多数被提出的架构基于循环神经网络(RNN)、卷积神经网络(CNN)和基于图的 CNN。在基于骨架的动作识别中,长期上下文信息的重要性是核心,而当前架构未能捕捉该信息。为获得更好的表示并捕捉长期时空关系,我们提出自注意力网络(SAN)的三种变体,即 SAN-V1、SAN-V2 和 SAN-V3。我们的 SAN 变体具有通过捕捉长程相关性来提取高层语义的出色能力。我们还将时序分段网络(TSN)与我们的 SAN 变体相集成,从而提升了整体性能。我们通过大量实验探索了自注意力网络(SAN)变体与时序分段网络(TSN)的不同配置。我们所选配置在 Kinetics 上分别以 4.4% 和 7.9% 优于最先进的 Top-1 和 Top-5,并在 NTU RGB+D 上展现出比最先进方法持续更优的性能。
引用
@article{arxiv.1912.08435,
title = {Self-Attention Network for Skeleton-based Human Action Recognition},
author = {Sangwoo Cho and Muhammad Hasan Maqbool and Fei Liu and Hassan Foroosh},
journal= {arXiv preprint arXiv:1912.08435},
year = {2019}
}
备注
WACV 2020 Paper