注意力机制 vs LSTM:提升巴希德语识别性能
计算机视觉与模式识别
2025-02-10 v2
摘要
印度尼西亚在全球失聪人数排名第四。对于听力受损者而言,沟通往往具有挑战性,迫切需要手语交流。然而,现有公共服务提供此类包容性服务的渠道有限。另一方面,人工智能技术的发展为解决听力受损者的沟通障碍提供了有前景的解决方案。本研究旨在探索人工智能技术在开发简化手语翻译应用和词典方面的应用,这些应用旨在集成到公共服务设施中,以促进听力受损者的沟通,从而提升公共服务的包容性。研究人员比较了LSTM和1D CNN + Transformer(1DCNNTrans)模型在手语识别中的性能。通过严格的测试和验证,发现LSTM模型达到了94.67%的准确率,而1DCNNTrans模型达到了96.12%的准确率。模型性能评估表明,尽管LSTM在推理延迟方面较低,但在分类相似关键点的类别时表现较弱。相比之下,1DCNNTrans模型在复杂程度不同的类别上表现出更大的稳定性和更高的F1分数。两个模型都表现出色,验证准确率均超过90%,并能快速分类50种手语手势。
关键词
引用
@article{arxiv.2409.01975,
title = {Attention vs LSTM: Improving Word-level BISINDO Recognition},
author = {Muchammad Daniyal Kautsar and Afra Majida Hariono and Ridwan Akmal},
journal= {arXiv preprint arXiv:2409.01975},
year = {2025}
}
备注
6 pages