中文

ViT-HGR:基于视觉 Transformer 的高密度表面肌电信号手部手势识别

计算机视觉与模式识别 2022-01-26 v1 机器学习 信号处理

摘要

近期,将深度学习(DL)模型应用于利用表面肌电图(sEMG)信号自主进行手部手势识别的兴趣显著增长。然而,DL 模型主要被设计用于稀疏 sEMG 信号。此外,由于其复杂结构,通常面临内存限制;需要较长训练时间与大量训练样本;且需借助数据增强和/或迁移学习。本文中,据我们所知首次研究并设计了基于视觉 Transformer(ViT)的架构,以从高密度(HD-sEMG)信号进行手部手势识别。直观而言,我们利用了 Transformer 架构在应对不同复杂问题中的近期突破性作用,及其通过注意力机制采用更多输入并行化的潜力。所提出的基于视觉 Transformer 的手部手势识别(ViT-HGR)框架可克服上述训练时间问题,并能在无需数据增强和/或迁移学习的情况下从零准确分类大量手部手势。所提 ViT-HGR 框架的效率使用近期发布的包含 65 个等长手部手势的 HD-sEMG 数据集评估。我们以 64 样本(31.25 ms)窗口大小的实验取得 84.62 ± 3.07% 的平均测试准确率,仅使用了 78,210 个参数。所提基于 ViT 的 ViT-HGR 框架的紧凑结构(即显著减少的可训练参数数量)显示了其在假肢控制中实际应用的巨大潜力。

关键词

引用

@article{arxiv.2201.10060,
  title  = {ViT-HGR: Vision Transformer-based Hand Gesture Recognition from High Density Surface EMG Signals},
  author = {Mansooreh Montazerin and Soheil Zabihi and Elahe Rahimian and Arash Mohammadi and Farnoosh Naderkhani},
  journal= {arXiv preprint arXiv:2201.10060},
  year   = {2022}
}