ViT-ReT:用于视频中人体活动识别的视觉与循环 Transformer 神经网络
计算机视觉与模式识别
2022-08-26 v2
摘要
人体活动识别是计算机视觉中一个新兴且重要的领域,旨在确定个体或群体所执行的活动。该领域的应用涵盖体育精彩视频生成、智能监控与手势识别。大多数活动识别系统依赖卷积神经网络(CNNs)从数据中提取特征,以及循环神经网络(RNNs)来确定数据的时间依赖特性。本文提出并设计了两个用于人体活动识别的 transformer 神经网络:一个循环 transformer(ReT),一种用于对数据序列进行预测的专用神经网络,以及一个视觉 transformer(ViT),一种为从图像提取显著特征而优化的 transformer,以提升活动识别的速度与可扩展性。我们针对所提 transformer 神经网络与基于 CNN 和 RNN 的当代人体活动识别模型,在速度与准确率方面进行了广泛比较。
引用
@article{arxiv.2208.07929,
title = {ViT-ReT: Vision and Recurrent Transformer Neural Networks for Human Activity Recognition in Videos},
author = {James Wensel and Hayat Ullah and Arslan Munir},
journal= {arXiv preprint arXiv:2208.07929},
year = {2022}
}