面向开放与封闭麦克风阵列配置的轻量且优化的声源定位与跟踪方法
音频与语音处理
2018-12-04 v1 声音
摘要
自然场景下的人机交互需要从环境中滤除不同的声源。这种能力通常涉及使用麦克风阵列来在线定位、跟踪并分离声源。多麦克风信号处理技术可以提高对噪声的鲁棒性,但处理成本随所用麦克风数量的增加而上升,限制了响应时间以及在各类移动机器人上的广泛应用。由于声源定位方法在计算资源上最为昂贵(涉及扫描大型三维空间),最小化所需计算量将有助于其在机器人上的实现与使用。机器人的外形也对麦克风阵列的几何结构与配置带来约束。此外,声源定位方法通常返回含噪特征,需要通过跟踪声源进行平滑与滤波。本文提出一种新颖的声源定位方法 SRP-PHAT-HSDA,其以粗、细分辨率网格扫描空间以减少内存查找次数;利用麦克风指向性模型减少需扫描的方向并忽略不显著的麦克风对;并引入一种配置方法,根据麦克风阵列形状自动设定通常凭经验调节的参数。在声源跟踪方面,本文提出一种改进的三维卡尔曼(M3K)方法,能够在三维空间中同时跟踪声源方向。使用 16 麦克风阵列与低成本硬件,结果表明 SRP-PHAT-HSDA 与 M3K 的性能至少与其他声源定位与跟踪方法相当,而计算资源分别最多减少 4 倍与 30 倍。
引用
@article{arxiv.1812.00115,
title = {Lightweight and Optimized Sound Source Localization and Tracking Methods for Open and Closed Microphone Array Configurations},
author = {Francois Grondin and Francois Michaud},
journal= {arXiv preprint arXiv:1812.00115},
year = {2018}
}