中文

面向印度手势语言识别的高效注意力轻量架构

计算机视觉与模式识别 2026-04-13 v1 机器学习

摘要

如何构建可以在手机上工作的手势语言识别器?这一问题驱动了本项工作。我们构建了EfficientSign,一种轻量级模型,采用EfficientNet-B0,并聚焦于两个注意力模块( Squeeze-and-Excitation用于通道关注,以及一个空间注意力层用于关注手势)。我们在印度手势语言字母库(12,637张图片,26个类别)上测试了它,采用5折交叉验证。EfficientSign实现了99.94%(±0.05%)的准确率,与ResNet18的99.97%准确率相当,但参数数目减少了62%(4.2M vs 11.2M)。我们还实验性地将深层特征(1,280维向量,从EfficientNet-B0的池化层中提取)输入到经典分类器中。SVM实现了99.63%的准确率,Logistic回归实现了99.03%的准确率,KNN实现了96.33%的准确率。所有这些方法都超越了2015年基于SURF的方法在类似数据集上实现的92%准确率。我们的结果表明,注意力增强的学习模型为ISL识别提供了一种高效且可部署的解决方案,无需巨型模型或手工调整的特征管道。

关键词

引用

@article{arxiv.2604.08694,
  title  = {EfficientSign: An Attention-Enhanced Lightweight Architecture for Indian Sign Language Recognition},
  author = {Rishabh Gupta and Shravya R. Nalla},
  journal= {arXiv preprint arXiv:2604.08694},
  year   = {2026}
}

备注

Submitted to IEEE Transactions on Human-Machine Systems