中文

基于直达路径特征和空间稀疏性正则化似然最大化的多声源定位

声音 2017-10-06 v2

摘要

本文利用声场景的双耳录音,解决了噪声和混响环境中的多声源定位问题。采用高斯混合模型,其分量对应于网格上定义的所有可能的候选声源位置。在给定一组观测到的双耳特征后,通过优化基于GMM的目标函数,选择具有最大先验概率的GMM分量来估计声源数量及其位置。这是通过强制执行稀疏解来实现的,从而相对于大量初始候选声源位置,倾向于少数声源。在似然函数中添加了一个基于熵的惩罚项,从而在GMM先验集上施加稀疏性。此外,使用直达路径相对传递函数来构建鲁棒的双耳特征。DP-RTF最近被提出用于单声源定位,并被证明对混响具有鲁棒性,因为它编码了对应于声音传播直达路径的通道间信息。在本文中,我们将DP-RTF估计扩展到多声源情况。在短时傅里叶变换域中,提出了一致性检验来检查一组连续帧是否与同一声源相关联。从通过一致性检验的帧中选择可靠的DP-RTF特征用于声源定位。使用仿真数据和机器人头部采集的真实数据进行的实验证实了所提出的多声源定位方法的有效性。

关键词

引用

@article{arxiv.1611.01172,
  title  = {Multiple-Speaker Localization Based on Direct-Path Features and Likelihood Maximization with Spatial Sparsity Regularization},
  author = {Xiaofei Li and Laurent Girin and Sharon Gannot and Radu Horaud},
  journal= {arXiv preprint arXiv:1611.01172},
  year   = {2017}
}

备注

16 pages, 4 figures, 4 tables