双耳流形上的声学空间学习用于声源分离与定位
声音
2015-02-06 v3
摘要
本文研究了建模全频谱声源产生的声学空间的问题,以及利用所学模型对同时发射稀疏频谱声音的多个声源进行定位和分离。我们为引入双耳流形范式奠定了理论和方法论基础。我们基于使用类人听觉运动机器人头部录制的语料库,对高维双耳频谱数据的潜在低维结构进行了深入研究。一种非线性降维技术表明,这些数据位于一个二维(2D)光滑流形上,该流形由听者的运动状态参数化,等价于声源方向。我们提出了一种专门设计用于处理具有内在分段线性结构的高维数据的概率分段仿射映射模型(PPAM)。我们推导了估计模型参数的封闭形式期望最大化(EM)过程,随后通过贝叶斯反演获得声源方向的完整后验密度函数。我们将此解扩展用于处理真实世界频谱图中的缺失数据和冗余,从而实现对语音等自然声源的2D定位。我们进一步将该模型推广到多个声源这一具有挑战性的情况,并提出了一种变分EM框架。相关算法被称为用于声源分离与定位的变分EM(VESSL),它对所有声源的2D位置和时间-频率掩码进行贝叶斯估计。与几种现有方法的比较表明,声学空间学习与贝叶斯推断的结合使我们的方法优于最先进方法。
引用
@article{arxiv.1402.2683,
title = {Acoustic Space Learning for Sound Source Separation and Localization on Binaural Manifolds},
author = {Antoine Deleforge and Florence Forbes and Radu Horaud},
journal= {arXiv preprint arXiv:1402.2683},
year = {2015}
}
备注
19 pages, 9 figures, 3 tables