中文

用于实时应用的人耳蜗力学与滤波器调谐的卷积神经网络模型

音频与语音处理 2021-02-09 v4 计算工程、金融与科学 机器学习 声音

摘要

听觉模型通常用作自动语音识别系统的特征提取器,或用作机器人、机器听觉与助听器应用的前端。尽管听觉模型能够非常详细地捕捉人类听觉的生物物理与非线性特性,但这些生物物理模型计算代价高昂,无法用于实时应用。我们提出了一种混合方法,将卷积神经网络与计算神经科学相结合,以产生用于人耳蜗力学的实时端到端模型,包括声级依赖的滤波器调谐(CoNNear)。CoNNear 模型在声学语音材料上训练,并使用耳蜗力学研究中常用的(未见的)声音刺激评估其性能与适用性。CoNNear 模型准确模拟了人耳蜗的频率选择性及其对声音强度的依赖,这是在负语音-背景噪声比下实现鲁棒语音可懂度的关键特性。CoNNear 架构基于并行且可微的计算,具备实现实时人类水平性能的能力。这些独特的 CoNNear 特性将赋能下一代类人机器听觉应用。

关键词

引用

@article{arxiv.2004.14832,
  title  = {A convolutional neural-network model of human cochlear mechanics and filter tuning for real-time applications},
  author = {Deepak Baby and Arthur Van Den Broucke and Sarah Verhulst},
  journal= {arXiv preprint arXiv:2004.14832},
  year   = {2021}
}