人类动作识别中的 RNN、CNN 与 Transformer:综述与混合模型
计算机视觉与模式识别
2024-08-16 v2 人工智能
机器学习
摘要
人类动作识别(HAR)涵盖了监控人类活动的任务,包括但不限于医疗、教育、娱乐、视觉监视、视频检索以及异常活动识别。过去十年,HAR 领域通过利用卷积神经网络(CNN)有效提取和理解复杂信息,显著提升了 HAR 系统的整体性能。最近,计算机视觉领域涌现出视觉 Transformer(ViT)作为强大的解决方案。Transformer 架构的有效性已超越图像分析领域,扩展到多样化的视频相关任务。值得注意的是,在这一landscape 中,研究社区对 HAR 表示浓厚兴趣,认识到其广泛实用性并在各类领域广泛采用。本文旨在呈现一项全面的调查,聚焦于 CNN 和从 RNN 演变到 ViT 的发展历程,鉴于其在 HAR 领域的重要性。通过对现有文献进行详尽检阅并探讨新兴趋势,本研究对该领域积累的知识进行批判性分析和综合。此外,本文探讨了开发混合方法的持续努力。沿着这一方向,本文提出了一种新型混合模型,旨在整合 CNN 和 ViT 的固有优势。
引用
@article{arxiv.2407.06162,
title = {RNNs, CNNs and Transformers in Human Action Recognition: A Survey and a Hybrid Model},
author = {Khaled Alomar and Halil Ibrahim Aysel and Xiaohao Cai},
journal= {arXiv preprint arXiv:2407.06162},
year = {2024}
}