中文

结合谱源模型与深度神经网络的鲁棒双耳目标声源定位

音频与语音处理 2019-04-08 v1 声音

摘要

尽管生物空间听觉中存在自上而下(例如注意力)效应的明确证据,但相对较少的机器听觉系统在声源定位中利用自上而下的基于模型的知识。本文通过提出一种新颖的双耳声源定位框架来解决这一问题,该框架结合了关于声源频谱特性的基于模型的信息和深度神经网络(DNN)。首先在训练阶段,利用从孤立声信号中提取的频谱特征估计目标源模型和背景源模型。当背景源的身份未知时,可以使用通用背景模型。在测试阶段,联合使用源模型来解释混合观测,并通过选择性加权由基于DNN的定位系统输出的声源方位后验概率来改进定位过程。为了解决训练和测试之间可能的不匹配,在测试过程中进一步采用在线模型自适应,以迭代方式直接从噪声观测中自适应背景模型参数。因此,所提出的系统将基于模型和数据驱动的信息流结合在一个统一的计算框架内。评估任务涉及在存在干扰源和房间混响的情况下定位目标语音源。我们的实验表明,通过这种方式利用基于模型的信息,可以在各种噪声和混响条件下显著提高声源定位性能。

关键词

引用

@article{arxiv.1904.03006,
  title  = {Robust Binaural Localization of a Target Sound Source by Combining Spectral Source Models and Deep Neural Networks},
  author = {Ning Ma and Jose A. Gonzalez and Guy J. Brown},
  journal= {arXiv preprint arXiv:1904.03006},
  year   = {2019}
}

备注

10 pages