基于深度学习的实时手语转文本翻译:LSTM 与 3D CNN 的比较研究
计算机视觉与模式识别
2025-11-19 v2
摘要
本研究探讨了 3D 卷积神经网络 (3D CNN) 和长短期记忆网络 (LSTM) 在实时美国手语 (ASL) 识别中的性能。虽然 3D CNN 在从视频序列中提取时空特征方面表现良好,但 LSTM 为处理序列数据中的时序依赖性而优化。我们在包含 50 类 1200 个 ASL 手势的数据集上评估两种架构,比较其准确率、计算效率和在相似训练条件下的延迟。实验结果表明,3D CNN 实现了 92.4% 的识别准确率,但每帧处理时间比 LSTM 高出 3.2%,而 LSTM 在准确率和资源消耗方面分别为 86.7% 和显著更低。混合 3D CNNLSTM 模型表现良好,表明在实际实现中,基于上下文的架构选择至关重要。该项目为开发辅助技术提供了专业基准,凸显了在边缘计算环境中识别精度与实时操作需求之间的权衡。
引用
@article{arxiv.2510.13137,
title = {Real-Time Sign Language to text Translation using Deep Learning: A Comparative study of LSTM and 3D CNN},
author = {Madhumati Pol and Anvay Anturkar and Anushka Khot and Ayush Andure and Aniruddha Ghosh and Anvit Magadum and Anvay Bahadur},
journal= {arXiv preprint arXiv:2510.13137},
year = {2025}
}