基于脉冲神经网络的时序信息重建与非对齐残差用于语音分类
声音
2025-01-03 v1 人工智能
音频与语音处理
摘要
最近注意到,大多数基于脉冲神经网络(SNN)的模型仅使用相同水平的时序分辨率来处理语音分类问题,这使得这些模型无法学习输入数据在不同时序尺度上的信息。此外,由于许多模型的子模块前后数据的时间长度不同,有效的残差连接无法用于优化这些模型的训练过程。为解决这些问题,本文一方面通过参考人类理解语音的层次处理过程,重构音频谱的时序维度,提出一种名为时序重建(Temporal Reconstruction, TR)的新方法。然后,采用TR的重构SNN模型可以学习输入数据在不同时序分辨率上的信息,并由于使网络能够在不同时序分辨率上学习输入数据的信息,从而从音频数据中建模更全面的语义信息。另一方面,我们通过分析音频数据,提出了非对齐残差(Non-Aligned Residual, NAR)方法,使得可以在两种时间长度不同的音频数据之间使用残差连接。我们在Spiking Speech Commands(SSC)、Spiking Heidelberg Digits(SHD)和Google Speech Commands v0.02(GSC)数据集上进行了大量实验。根据实验结果,我们在SSC上实现了所有SNN模型的测试分类准确率最高纪录81.02%,在SHD上实现了所有模型的分类准确率最高纪录96.04%。
引用
@article{arxiv.2501.00348,
title = {Temporal Information Reconstruction and Non-Aligned Residual in Spiking Neural Networks for Speech Classification},
author = {Qi Zhang and Huamin Wang and Hangchi Shen and Shukai Duan and Shiping Wen and Tingwen Huang},
journal= {arXiv preprint arXiv:2501.00348},
year = {2025}
}
备注
9 pages, 5 figures