基于通用声学模型的声源定位导向响应功率方法
音频与语音处理
2026-02-10 v1 声音
摘要
导向响应功率(SRP)方法是利用麦克风阵列进行声源定位的最常用方法之一。它通常基于简化的声学假设,例如麦克风阵列远场中的全向声源、自由场传播以及空间不相关噪声。然而在现实中,许多声学场景并不满足这些假设。本文提出了一种对传统 SRP 方法的推广,允许应用通用声学模型进行任意麦克风阵列构型的定位。例如,这些模型可以考虑分布式麦克风中的声级差异、声源和接收器的指向性,或声学阴影效应。此外,也可以将实测声学传递函数作为声学模型应用。我们表明,传统 SRP 的延迟求和波束形成对于使用通用声学模型进行定位并非最优。为此,我们提出了一种考虑通用声学模型和空间相关噪声的广义 SRP 波束形成准则,并推导出最优 SRP 波束形成器。此外,我们提出并分析了适当的频率加权。与传统 SRP 不同,所提方法可以联合利用麦克风信号之间观测到的声级和时间差异来推断声源位置。在多种噪声条件下,对三种不同麦克风设置进行语音的真实场景仿真表明,与传统 SRP 相比,所提方法能显著降低平均定位误差,特别是在噪声条件下可降低 60% 以上。
引用
@article{arxiv.2509.15702,
title = {A Steered Response Power Method for Sound Source Localization With Generic Acoustic Models},
author = {Kaspar Müller and Markus Buck and Simon Doclo and Jan Østergaard and Tobias Wolff},
journal= {arXiv preprint arXiv:2509.15702},
year = {2026}
}
备注
Accepted for publication in IEEE Transactions on Audio, Speech and Language Processing