面向印度手势语言识别的高效注意力轻量架构
计算机视觉与模式识别
2026-04-13 v1 机器学习
摘要
如何构建可以在手机上工作的手势语言识别器?这一问题驱动了本项工作。我们构建了EfficientSign,一种轻量级模型,采用EfficientNet-B0,并聚焦于两个注意力模块( Squeeze-and-Excitation用于通道关注,以及一个空间注意力层用于关注手势)。我们在印度手势语言字母库(12,637张图片,26个类别)上测试了它,采用5折交叉验证。EfficientSign实现了99.94%(±0.05%)的准确率,与ResNet18的99.97%准确率相当,但参数数目减少了62%(4.2M vs 11.2M)。我们还实验性地将深层特征(1,280维向量,从EfficientNet-B0的池化层中提取)输入到经典分类器中。SVM实现了99.63%的准确率,Logistic回归实现了99.03%的准确率,KNN实现了96.33%的准确率。所有这些方法都超越了2015年基于SURF的方法在类似数据集上实现的92%准确率。我们的结果表明,注意力增强的学习模型为ISL识别提供了一种高效且可部署的解决方案,无需巨型模型或手工调整的特征管道。
引用
@article{arxiv.2604.08694,
title = {EfficientSign: An Attention-Enhanced Lightweight Architecture for Indian Sign Language Recognition},
author = {Rishabh Gupta and Shravya R. Nalla},
journal= {arXiv preprint arXiv:2604.08694},
year = {2026}
}
备注
Submitted to IEEE Transactions on Human-Machine Systems