中文

SpikCommander:一种结合多视图学习的高性能脉冲Transformer用于高效语音命令识别

声音 2026-01-21 v3 机器学习

摘要

脉冲神经网络(SNN)通过利用其事件驱动的处理范式,为实现节能的语音命令识别(SCR)提供了一条有前景的路径。然而,现有的基于SNN的SCR方法由于有限的时间建模和基于二进制脉冲的表示,通常难以捕捉语音中丰富的时间依赖性和上下文信息。为了解决这些挑战,我们首先引入了多视图脉冲时间感知自注意力(MSTASA)模块,该模块将有效的脉冲时间感知注意力与多视图学习框架相结合,以建模语音命令中的互补时间依赖性。基于MSTASA,我们进一步提出了SpikCommander,一种完全脉冲驱动的Transformer架构,它将MSTASA与脉冲上下文细化通道MLP(SCR-MLP)相结合,以共同增强时间上下文建模和通道级特征整合。我们在三个基准数据集上评估了我们的方法:Spiking Heidelberg Dataset(SHD)、Spiking Speech Commands(SSC)和Google Speech Commands V2(GSC)。大量实验表明,SpikCommander在可比时间步长下,以更少的参数持续优于最先进的(SOTA)SNN方法,突显了其在鲁棒语音命令识别方面的有效性和效率。

关键词

引用

@article{arxiv.2511.07883,
  title  = {SpikCommander: A High-performance Spiking Transformer with Multi-view Learning for Efficient Speech Command Recognition},
  author = {Jiaqi Wang and Liutao Yu and Xiongri Shen and Sihang Guo and Chenlin Zhou and Leilei Zhao and Yi Zhong and Zhiguo Zhang and Zhengyu Ma},
  journal= {arXiv preprint arXiv:2511.07883},
  year   = {2026}
}

备注

Accepted by The Fortieth AAAI Conference on Artificial Intelligence (AAAI 2026)