基于双向储存器计算的手势语言识别
机器人学
2025-12-24 v1 计算机视觉与模式识别
摘要
手势语言识别(SLR)促进了听障者与听力人士之间的沟通。深度学习广泛用于开发基于 SLR 的系统;然而,它计算密集,需大量计算资源,难以适用于资源受限的设备。为此,本文提出一种基于 MediaPipe 和基于回声状态网络(ESN)的双向储存器计算(BRC)架构的高效手势语言识别系统。MediaPipe 提取手部关节点坐标,作为 ESN 基于 BRC 架构的输入。BRC 以正向和逆向两个方向处理这些特征,高效捕获时序依赖性。BRC 的 resulting 状态被拼接以形成用于分类的稳健表征。在我们评估了基于 Word-Level American Sign Language(WLASL)视频数据集的方法,实现了 57.71% 的竞争性准确率,而训练时间仅为 9 秒,与深度学习基于 Bi-GRU 方法所需的 55 分钟和 38 秒相比,后者显著更慢。因此,基于 BRC 的 SLR 系统非常适用于边缘设备。
引用
@article{arxiv.2512.00777,
title = {Sign Language Recognition using Bidirectional Reservoir Computing},
author = {Nitin Kumar Singh and Arie Rachmad Syulistyo and Yuichiro Tanaka and Hakaru Tamukoh},
journal= {arXiv preprint arXiv:2512.00777},
year = {2025}
}