中文

基于稠密波束合成能量图的无人机声学成像与U-Net SELD

音频与语音处理 2026-03-30 v3 人工智能 声音 信号处理

摘要

我们提出一种用于360度声源定位的U-Net模型,将其建模为球面语义分割任务。不同于对离散到达方向(DoA)角度进行回归,我们的方法将波束合成后的音频图(方位角与仰角)分割为声源活跃区域的存在。采用延迟求和(DAS)波束成形技术,对定制的24麦克风阵列进行处理,生成与无人机GPS遥测同步的信号,以创建二进制监督掩码。经过修改的U-Net模型在这些图的频域表示上进行训练,学习识别空间分布的源区域,并通过Tversky损失解决类别不平衡问题。由于该网络 operates on波束合成能量图,方法本身对阵列无关,可适应不同麦克风配置,并可转移到不同的麦克风配置中。分割输出经计算激活区域的质心后处理,实现鲁棒的DoA估计。我们的数据集包括DJI Air 3无人机的真实世界野外录音,同步360度视频和飞行日志,覆盖多个日期和地点。实验结果表明,U-Net在不同环境下具有良好的泛化性,提供更精确的角度精度,为超越传统声源定位(SSL)的稠密空间音频理解提供了新范式。我们还在DCASE 2019 TAU空间声事件基准上验证了相同的波束合成+分割公式,表明该方法不仅适用于无人机声学,也适用于多类声事件定位与检测(SELD)场景。

关键词

引用

@article{arxiv.2508.00307,
  title  = {Acoustic Imaging for UAV Detection: Dense Beamformed Energy Maps and U-Net SELD},
  author = {Belman Jahir Rodriguez and Sergio F. Chevtchenko and Marcelo Herrera Martinez and Yeshwanth Bethi and Saeed Afshar},
  journal= {arXiv preprint arXiv:2508.00307},
  year   = {2026}
}