基于双麦克风阵列的神经定向语音增强
音频与语音处理
2024-12-31 v2 声音
摘要
在多说话人场景中,利用空间特征对于语音增强至关重要。尽管拥有有限的麦克风阵列,但在极端低信噪比(SNR)条件下,开发紧凑的多通道语音增强系统仍具有挑战性。为此,我们提出一种三向引导空间选择方法,一种灵活的框架使用三个引导向量来指导增强并确定增强范围。具体而言,我们引入一种因果定向 U-Net(CDUNet)模型,该模型以原始多通道语音和所需增强宽度作为输入。从而根据目标方向动态调整引导向量,并根据目标信号与干扰信号之间的角度分离对增强区域进行微调。我们的方法仅需双麦克风阵列,即可在语音质量和下游任务性能方面取得优异表现。该模型实时运行,参数数量最少,适用于低延迟、设备端流式应用。
引用
@article{arxiv.2412.18141,
title = {Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario},
author = {Wen Wen and Qiang Zhou and Yu Xi and Haoyu Li and Ziqi Gong and Kai Yu},
journal= {arXiv preprint arXiv:2412.18141},
year = {2024}
}
备注
Accepted by ICASSP 2025