利用参数化神经网络学习复杂声音的频率-时间表征
声音
2021-08-04 v1 机器学习
音频与语音处理
信号处理
摘要
得益于近期在多种听觉任务上的成功,深度学习模型已成为听觉神经科学研究的潜在候选者。然而,这些模型往往缺乏可解释性,难以完全理解其所执行的确切计算过程。在此,我们提出了一个参数化神经网络层,它基于 Gabor 核(可学习 STRF)计算特定的频率-时间调制,并且完全可解释。我们在语音活动检测、说话人验证、城市声音分类和斑胸草雀鸣叫类型分类上评估了该层的预测能力。我们发现,基于可学习 STRF 的模型在所有任务上与不同的 topline 模型表现相当,并在语音活动检测上取得最佳性能。由于该层完全可解释,我们使用定量度量来描述所学频率-时间调制的分布。滤波器针对各任务进行了自适应,并主要聚焦于低时间调制和低频谱调制。分析表明,在人类语音上学习到的滤波器具有与直接在人类听觉皮层中测量到的滤波器相似的频率-时间参数。最后,我们观察到这些任务以有意义的方式组织:人类发声任务彼此更接近,而鸟类发声任务远离人类发声和城市声音任务。
引用
@article{arxiv.2103.07125,
title = {Learning spectro-temporal representations of complex sounds with parameterized neural networks},
author = {Rachid Riad and Julien Karadayi and Anne-Catherine Bachoud-Lévi and Emmanuel Dupoux},
journal= {arXiv preprint arXiv:2103.07125},
year = {2021}
}