HAN:一种用于基于骨架手势识别的高效分层自注意力网络
计算机视觉与模式识别
2021-06-28 v1
摘要
先前基于骨架的手势识别方法多将骨架序列排列为伪图像或时空图,并应用深度卷积神经网络(CNN)或图卷积网络(GCN)进行特征提取。尽管取得了优异结果,这些方法在动态捕捉交互手部局部的局部特征方面存在固有局限,且计算效率仍是一严重问题。本工作中,引入自注意力机制以缓解该问题。考虑到手部关节的分层结构,我们提出一种高效的用于基于骨架手势识别的分层自注意力网络(HAN),其基于纯自注意力,不含任何 CNN、RNN 或 GCN 算子。具体而言,关节自注意力模块用于捕捉手指的空间特征,手指自注意力模块用于聚合整手的特征。对于时间特征,时间自注意力模块用于捕捉手指与整手的时间动态。最后,这些特征由融合自注意力模块融合以进行手势分类。实验表明,我们的方法在三个手势识别数据集上以低得多的计算复杂度取得了具竞争力的结果。
引用
@article{arxiv.2106.13391,
title = {HAN: An Efficient Hierarchical Self-Attention Network for Skeleton-Based Gesture Recognition},
author = {Jianbo Liu and Ying Wang and Shiming Xiang and Chunhong Pan},
journal= {arXiv preprint arXiv:2106.13391},
year = {2021}
}
备注
Under peer review for TCSVT