基于脉冲神经网络的多音相位编码双耳时间差
音频与语音处理
2020-07-08 v1 神经与进化计算
声音
摘要
受哺乳动物听觉定位通路启发,本文提出一种纯脉冲神经网络(spiking neural network, SNN)计算模型,用于噪声真实世界环境下的精确声源定位,并在带麦克风阵列的实时机器人系统中实现该算法。该模型的关键在于 MTPC 方案,其将双耳时间差(interaural time difference, ITD)线索编码为脉冲模式。该方案自然遵循人类听觉定位系统的功能结构,而非人为计算到达时间差。此外,它凸显了 SNN 的事件驱动与功耗效率优势。MTPC 与两种不同 SNN 架构(卷积 SNN 与循环 SNN)流水线衔接,由此展现出对各种 SNN 的适用性。该方案通过麦克风采集的依赖于位置的声学数据,在含噪声、遮挡、反射或其他影响的真实环境中评估。实验结果显示平均方位误差为 1~3 度,超越了其他生物学合理的神经形态声源定位方法的精度。
引用
@article{arxiv.2007.03274,
title = {Multi-Tones' Phase Coding (MTPC) of Interaural Time Difference by Spiking Neural Network},
author = {Zihan Pan and Malu Zhang and Jibin Wu and Haizhou Li},
journal= {arXiv preprint arXiv:2007.03274},
year = {2020}
}