中文

用于驾驶员活动识别的粗粒度时间注意力网络(CTA-Net)

计算机视觉与模式识别 2021-01-19 v1 人工智能 机器学习

摘要

在从视频中识别传统人类活动方面已取得显著进展,这些活动侧重于涉及判别性身体运动、身体-物体和/或人人交互的高度 distinctive 动作。驾驶员的活动则不同,因为它们由同一主体以相似的身体部位运动执行,导致细微变化。为此,我们提出了一种利用时空注意力来建模细微变化的新颖框架。我们的模型名为粗粒度时间注意力网络(CTA-Net),其中在可训练的 glimpse 网络中引入了粗粒度时间分支。目标是让 glimpse 通过聚焦于视频的特定部分来捕捉高层时间关系,如“期间”、“之前”和“之后”。这些分支还尊重视频中时间动态的拓扑结构,确保不同分支学习到有意义的空间和时间变化。然后该模型使用一种创新的注意力机制,通过探索 LSTM 的隐藏状态来生成用于活动识别的高层动作特定上下文信息。该注意力机制有助于学习在构建视频表示时通过对隐藏状态加权来决定每个隐藏状态对识别任务的重要性。我们的方法在四个公开可获取的数据集上进行了评估,仅以 RGB 视频作为输入,以可观的幅度显著优于当前最优方法。

关键词

引用

@article{arxiv.2101.06636,
  title  = {Coarse Temporal Attention Network (CTA-Net) for Driver's Activity Recognition},
  author = {Zachary Wharton and Ardhendu Behera and Yonghuai Liu and Nik Bessis},
  journal= {arXiv preprint arXiv:2101.06636},
  year   = {2021}
}

备注

Extended version of the accepted WACV 2021