从 CNN 到 Transformer:多模态人类动作识别综述
计算机视觉与模式识别
2024-05-28 v1
摘要
由于其广泛的应用前景,人类动作识别是计算机视觉中最受关注的研究问题之一。最近的研究表明,使用多模态数据进行处理可比单一模态方法取得更佳性能。在过去十年中,深度学习用于视觉建模的过程中,动作识别方法主要依赖于卷积神经网络(CNN)。然而,近期 Transformer 在视觉建模方面的崛起正在导致动作识别任务发生范式转变。本综述捕捉了这一转变,同时聚焦于多模态人类动作识别(MHAR)。多模态计算模型的独特之处在于“融合”单个数据模态特征的过程。因此,我们特别关注 MHAR 方法中融合设计方面的问题。我们分析了经典和新兴技术,同时也强调了 CNN 和 Transformer 构建模块在整体问题上受欢迎的趋势。在 particular,我们强调最近的设计选择如何导致更高效的 MHAR 模型。与现有综述不同,本综述专注于推动 MHAR 研究发展,识别具有前景的建构性和融合设计选择以训练实用模型。我们还从规模和评估角度概述了多模态数据集。最后,基于所审阅的文献,我们讨论了 MHAR 的挑战和未来方向。
关键词
引用
@article{arxiv.2405.15813,
title = {From CNNs to Transformers in Multimodal Human Action Recognition: A Survey},
author = {Muhammad Bilal Shaikh and Syed Mohammed Shamsul Islam and Douglas Chai and Naveed Akhtar},
journal= {arXiv preprint arXiv:2405.15813},
year = {2024}
}
备注
23 pages, 5 figures and 3 Tables. To appear in ACM Trans. Multimedia Comput. Commun. Appl.(TOMM) 2024