中文

AmbiDrop:基于 Ambisonics 编码和 Dropout-Based 学习的数组无关语音增强

音频与语音处理 2025-09-19 v1

摘要

多通道语音增强利用空间线索来提高语音可理解性和质量,但大多数基于学习的方法依赖于特定的麦克风阵列几何,无法处理几何变化。为缓解这一限制,当前的阵列无关方法采用大型多几何数据集,但可能仍无法对未见的布局进行泛化。我们提出了 AmbbiDrop(Ambisonics with Dropouts),一种基于 Ambisonics 的框架,通过 Ambisonics Signal Matching(ASM)将任意阵列录音编码到球面调和和域中。使用模拟 Ambisonics 数据训练深度神经网络,并结合通道 Dropout 以提高对阵列相关编码错误的鲁棒性,从而无需多样化的麦克风阵列数据库。实验表明,基线模型和所提方法在训练阵列上性能相似,但基线模型在未见阵列上会退化。相比之下,AmbiDrop 在 SI-SDR、PESQ 和 STOI 指标上持续改进,显示出强大的泛化能力和实际应用潜力。

关键词

引用

@article{arxiv.2509.14855,
  title  = {AmbiDrop: Array-Agnostic Speech Enhancement Using Ambisonics Encoding and Dropout-Based Learning},
  author = {Michael Tatarjitzky and Boaz Rafaely},
  journal= {arXiv preprint arXiv:2509.14855},
  year   = {2025}
}

备注

Submitted to ICASSP 2026