中文

基于 CNN 与 SRP-PHAT 的极限边缘鲁棒声源定位

音频与语音处理 2025-03-05 v1 声音

摘要

针对存在噪声和混响环境的鲁棒声源定位,越来越多地利用输入各种声学特征的深度神经网络。然而,最先进的研究主要集中在优化算法精度上,导致模型庞大,阻碍了边缘设备的部署。但是,边缘应用(如助听器和机器人交互)迫切需要实时、低占用的声学推理。因此,我们从使用 SRP-PHAT 特征的鲁棒 CNN 模型 Cross3D [16] 出发,为极限边缘寻求高效且紧凑的模型架构。针对 SRP 特征表示和神经网络,我们分别提出了可扩展的 LC-SRP-Edge 和 Cross3D-Edge 算法,并针对更低的硬件开销进行了优化。与原始的 LC-SRP [19] 相比,LC-SRP-Edge 将 sinc 插值的复杂度和片上内存开销减半。在多种 SRP 分辨率情况下,Cross3D-Edge 与 Cross3D 基线相比节省了 10.32%~73.71% 的计算复杂度和 59.77%~94.66% 的神经网络权重。在精度与效率的权衡方面,最平衡的版本 (EM) 仅需 127.1 MFLOPS 的计算量、3.71 MByte/s 的带宽和总计 0.821 MByte 的片上内存,同时在最先进的精度比较中仍保持竞争力。它在 Raspberry Pi 4B 上实现了 8.59 ms/帧的端到端延迟,比相应的基线快 7.26 倍。

关键词

引用

@article{arxiv.2503.02046,
  title  = {CNN-based Robust Sound Source Localization with SRP-PHAT for the Extreme Edge},
  author = {Jun Yin and Marian Verhelst},
  journal= {arXiv preprint arXiv:2503.02046},
  year   = {2025}
}