中文

基于流形正则化的半监督声源定位

声音 2015-08-14 v1

摘要

传统的说话人定位算法仅基于接收到的麦克风信号,通常对不利条件敏感,例如高混响或低信噪比(SNR)。在一些场景中,例如会议室或汽车内,可以假设声源位置被限制在一个预定义区域,且环境的声学参数近似固定。此类场景引出了这样的假设:来自感兴趣区域的声学样本具有独特的几何结构。在本文中,我们展示高维声学样本确实位于低维流形上,并且可以嵌入到低维空间中。受此结果启发,我们提出了一种半监督声源定位算法,其恢复声学样本与它们对应位置之间的逆映射。其思想是采用基于流形正则化的优化框架,该框架包含可能解相对于流形的平滑性约束。所提出的算法称为用于定位的流形正则化(Manifold Regularization for Localization, MRL),以自适应方式实现。初始化仅使用少量带有相应声源位置的标记样本进行,然后随着接收到新的未标记样本(声源位置未知)系统逐渐自适应。实验结果表明,与最近提出的基于流形学习方法的算法以及作为基线的广义互相关(GCC)算法相比,具有更优的定位性能。

关键词

引用

@article{arxiv.1508.03148,
  title  = {Semi-Supervised Sound Source Localization Based on Manifold Regularization},
  author = {Bracha Laufer-Goldshtein and Ronen Talmon and Sharon Gannot},
  journal= {arXiv preprint arXiv:1508.03148},
  year   = {2015}
}