基于并行双向储备计算的手语识别
计算机视觉与模式识别
2026-01-06 v1 机器人学
摘要
手语识别 (SLR) 促进了哑人和听人群之间的沟通。深度学习基于的 SLR 模型常被使用,但需要大量计算资源,不适用于部署在边缘设备上。为解决这些限制,本文提出一种轻量级 SLR 系统,将并行双向储备计算 (PBRC) 与 MediaPipe 结合。MediaPipe 实现了实时手部跟踪和精确的手部关节坐标提取,这些坐标作为 PBRC 架构的输入特征。所提出的 PBRC 架构由两个基于回声状态网络 (ESN) 的双向储备计算 (BRC) 模块并行组成,以捕获时间依赖性,从而为分类创建丰富的特征表征。我们在 Word-Level American Sign Language (WLASL) 视频数据集上训练了基于 PBRC 的 SLR 系统,实现了 top-1、top-5 和 top-10 准确率分别为 60.85%、85.86% 和 91.74%。由于储备计算的内在特性,训练时间显著缩短至 18.67 秒,与深度学习方法如 Bi-GRU 所需的 55 分钟以上相比。这一方法为在边缘设备上实现实时 SLR 提供了轻量、经济的解决方案。
引用
@article{arxiv.2512.19451,
title = {Sign Language Recognition using Parallel Bidirectional Reservoir Computing},
author = {Nitin Kumar Singh and Arie Rachmad Syulistyo and Yuichiro Tanaka and Hakaru Tamukoh},
journal= {arXiv preprint arXiv:2512.19451},
year = {2026}
}