中文

STAR:基于稀疏 Transformer 的动作识别

计算机视觉与模式识别 2021-07-16 v1 人工智能

摘要

人类动作与行为的认知系统已发展为深度学习范式,尤其是图卷积网络的出现近年来改变了该领域。然而,以往工作主要聚焦于基于稠密图卷积网络的过度参数化复杂模型,导致训练与推理效率低下。同时,基于 Transformer 架构的模型尚未在人类动作与行为估计的认知应用中得到充分探索。本文提出一种新颖的基于骨架的人体动作识别模型,对数据的空间维度采用稀疏注意力,对时间维度采用分段线性注意力。我们的模型还能将变长视频片段作为一个批次进行处理。实验表明,我们的模型在可训练参数大幅减少的同时取得了可比性能,并在训练与推理中达到高速度。实验显示,在具有竞争力的准确率下,与基线模型相比,我们的模型实现了 4~18 倍加速,且模型大小为基线模型的 1/7~1/15。

关键词

引用

@article{arxiv.2107.07089,
  title  = {STAR: Sparse Transformer-based Action Recognition},
  author = {Feng Shi and Chonghan Lee and Liang Qiu and Yizhou Zhao and Tianyi Shen and Shivran Muralidhar and Tian Han and Song-Chun Zhu and Vijaykrishnan Narayanan},
  journal= {arXiv preprint arXiv:2107.07089},
  year   = {2021}
}