SkelVIT:基于轻量级骨架的动作识别系统中 Vision Transformer 的共识
计算机视觉与模式识别
2024-08-01 v2 人工智能
机器学习
机器人学
摘要
基于骨架的动作识别受到许多研究者的关注,因为它对视角和光照变化具有鲁棒性,且处理比视频帧处理高效得多。随着深度学习模型的出现,将骨架数据表示为伪图像形式并应用 CNN 进行动作识别已变得非常流行。此后,研究集中于寻找形成伪图像的有效方法。近来,注意力网络,更具体地 transformer,已在各种视觉问题中提供了有前景的结果。在本研究中,考察了 VIT 用于基于骨架的动作识别的有效性,并探究了其对伪图像表示方案的鲁棒性。为此,提出了一种三级架构 SkelVit,其形成一组伪图像,对每种表示应用分类器,并组合其结果以找出最终动作类别。SkelVit 的性能通过一组实验被彻底检验。首先,通过与两种最先进伪图像表示方法比较,考察系统对表示的敏感性。然后,SkelVit 的分类器在两种实验设置中由 CNN 和 VIT 实现,并比较其性能。在最终实验设置中,通过以不同数量分类器应用模型,考察了组合分类器的贡献。实验研究表明,所提系统以其轻量级表示方案取得了优于最先进方法的结果。还观察到视觉 transformer 相较于 CNN 对初始伪图像表示较不敏感。然而,即便使用视觉 transformer,识别性能仍可通过分类器共识进一步提升。
引用
@article{arxiv.2311.08094,
title = {SkelVIT: Consensus of Vision Transformers for a Lightweight Skeleton-Based Action Recognition System},
author = {Ozge Oztimur Karadag},
journal= {arXiv preprint arXiv:2311.08094},
year = {2024}
}