中文

面向嵌入式系统的基于 LogNNet 储备池计算的语音指令识别

声音 2025-09-03 v1 人工智能 机器学习 音频与语音处理

摘要

本文提出了一种低资源语音指令识别器,它结合了基于能量的语音活动检测(VAD)、优化的梅尔频率倒谱系数(MFCC)流水线以及 LogNNet 储备池计算分类器。使用来自语音指令数据集并降采样至 8 kHz 的四条指令,我们评估了四种 MFCC 聚合方案,发现自适应分箱(64 维特征向量)提供了最佳的精度与紧凑性权衡。采用 64:33:9:4 架构的 LogNNet 分类器在说话人无关评估下达到了 92.04% 的准确率,同时所需的参数远少于传统的深度学习模型。在 Arduino Nano 33 IoT(ARM Cortex-M0+,48 MHz,32 KB RAM)上的硬件实现验证了其实际可行性,实现了约 90% 的实时识别准确率,而仅消耗 18 KB RAM(利用率为 55%)。因此,完整的流水线(VAD -> MFCC -> LogNNet)能够在严格的内存和计算限制下实现可靠的设备端语音指令识别,使其适用于电池供电的物联网节点、无线传感器网络和免提控制接口。

关键词

引用

@article{arxiv.2509.00862,
  title  = {Speech Command Recognition Using LogNNet Reservoir Computing for Embedded Systems},
  author = {Yuriy Izotov and Andrei Velichko},
  journal= {arXiv preprint arXiv:2509.00862},
  year   = {2025}
}

备注

20 pages, 6 figures