基于稠密波束合成能量图的无人机声学成像与U-Net SELD
音频与语音处理
2026-03-30 v3 人工智能
声音
信号处理
摘要
我们提出一种用于360度声源定位的U-Net模型,将其建模为球面语义分割任务。不同于对离散到达方向(DoA)角度进行回归,我们的方法将波束合成后的音频图(方位角与仰角)分割为声源活跃区域的存在。采用延迟求和(DAS)波束成形技术,对定制的24麦克风阵列进行处理,生成与无人机GPS遥测同步的信号,以创建二进制监督掩码。经过修改的U-Net模型在这些图的频域表示上进行训练,学习识别空间分布的源区域,并通过Tversky损失解决类别不平衡问题。由于该网络 operates on波束合成能量图,方法本身对阵列无关,可适应不同麦克风配置,并可转移到不同的麦克风配置中。分割输出经计算激活区域的质心后处理,实现鲁棒的DoA估计。我们的数据集包括DJI Air 3无人机的真实世界野外录音,同步360度视频和飞行日志,覆盖多个日期和地点。实验结果表明,U-Net在不同环境下具有良好的泛化性,提供更精确的角度精度,为超越传统声源定位(SSL)的稠密空间音频理解提供了新范式。我们还在DCASE 2019 TAU空间声事件基准上验证了相同的波束合成+分割公式,表明该方法不仅适用于无人机声学,也适用于多类声事件定位与检测(SELD)场景。
引用
@article{arxiv.2508.00307,
title = {Acoustic Imaging for UAV Detection: Dense Beamformed Energy Maps and U-Net SELD},
author = {Belman Jahir Rodriguez and Sergio F. Chevtchenko and Marcelo Herrera Martinez and Yeshwanth Bethi and Saeed Afshar},
journal= {arXiv preprint arXiv:2508.00307},
year = {2026}
}