中文

基于混合模型与学习方法的无人机自噪声鲁棒声源定位与语音增强

音频与语音处理 2025-08-11 v1

摘要

无人机在搜索救援任务乃至军事行动中正变得日益重要。虽然大多数无人机配备了相机视觉能力,但由于减轻旋翼产生的自噪声这一固有挑战,无人机听觉领域仍未被充分探索。本文提出了一种新技术,以解决嵌入麦克风的无人机所面临的极低信噪比(SNR)问题。该技术采用一种混合方法实现,结合了阵列信号处理(ASP)和深度神经网络(DNN),以增强由安装在四旋翼无人机上的六麦克风均匀圆形阵列捕获的语音信号。该系统通过波束扫描结合广义旁瓣消除器-DeepFilterNet 2(GSC-DF2)系统进行语音增强,实现对目标说话人的定位。为验证该系统,我们使用了 DREGON 数据集和实测数据。对所提出的混合模型进行的客观评估表明,在低至 -30 dB 的信噪比条件下,其性能优于四种基线方法。

关键词

引用

@article{arxiv.2508.06310,
  title  = {Egonoise Resilient Source Localization and Speech Enhancement for Drones Using a Hybrid Model and Learning-Based Approach},
  author = {Yihsuan Wu and Yukai Chiu and Michael Anthony and Mingsian R. Bai},
  journal= {arXiv preprint arXiv:2508.06310},
  year   = {2025}
}