中文

基于双麦克风阵列的神经定向语音增强

音频与语音处理 2024-12-31 v2 声音

摘要

在多说话人场景中,利用空间特征对于语音增强至关重要。尽管拥有有限的麦克风阵列,但在极端低信噪比(SNR)条件下,开发紧凑的多通道语音增强系统仍具有挑战性。为此,我们提出一种三向引导空间选择方法,一种灵活的框架使用三个引导向量来指导增强并确定增强范围。具体而言,我们引入一种因果定向 U-Net(CDUNet)模型,该模型以原始多通道语音和所需增强宽度作为输入。从而根据目标方向动态调整引导向量,并根据目标信号与干扰信号之间的角度分离对增强区域进行微调。我们的方法仅需双麦克风阵列,即可在语音质量和下游任务性能方面取得优异表现。该模型实时运行,参数数量最少,适用于低延迟、设备端流式应用。

关键词

引用

@article{arxiv.2412.18141,
  title  = {Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario},
  author = {Wen Wen and Qiang Zhou and Yu Xi and Haoyu Li and Ziqi Gong and Kai Yu},
  journal= {arXiv preprint arXiv:2412.18141},
  year   = {2024}
}

备注

Accepted by ICASSP 2025