Real-Time American Sign Language Recognition Using 3D Convolutional Neural Networks and LSTM: Architecture, Training, and Deployment
计算机视觉与模式识别
2025-12-30 v1
摘要
本文提出了一种实时美国手语(ASL)识别系统,利用 3D 卷积神经网络(CNN)与长短期记忆(LSTM)网络的混合深度学习架构。该系统处理网页摄像头视频流以识别单词级别的 ASL 手势,旨在解决为全球超过 700 万聋人和半聋人之间的沟通障碍。我们的架构利用 3D 卷积捕获视频帧的时空特征,随后通过 LSTM 层建模手势中固有的序列依赖性。该系统在 WLASL 数据集(2000 个常见单词)、ASL-LEX 词汇数据库(~2700 个手语)和一组精选的 100 个专家标注的 ASL 手势上训练,实现了 0.71 到 0.99 之间的 F1 分数。该模型部署在 AWS 基础设施上,支持在 OAK-D 摄像头上进行边缘部署以实现实时推理。我们讨论了架构设计、训练方法、评估指标以及实用可访问性应用的部署考虑因素。
引用
@article{arxiv.2512.22177,
title = {Real-Time American Sign Language Recognition Using 3D Convolutional Neural Networks and LSTM: Architecture, Training, and Deployment},
author = {Dawnena Key},
journal= {arXiv preprint arXiv:2512.22177},
year = {2025}
}
备注
10 pages, 1 figure, 2 tables. Patent pending (US 63/918,518). Code available at https://github.com/dawnenakey/spokhandSLR