利用空间信息增强神经波束形成器的目标语音提取
声音
2023-06-29 v1 人工智能
音频与语音处理
摘要
近来,基于深度学习的波束形成算法在目标语音提取任务中展现出良好性能。然而,多数系统未充分利用空间信息。本文中,我们提出一种利用空间信息以增强神经波束形成器性能的目标语音提取网络。为此,我们首先使用 UNet-TCN 结构对输入特征建模,并通过避免其他模型中直接降维导致的信息损失来提高语音预分离模块的估计精度。此外,我们引入多头交叉注意力机制,通过充分利用阵列接收到的空间信息,增强神经波束形成器对空间信息的感知。实验结果表明,我们将更合理的目标掩码估计网络与基于空间信息的交叉注意力机制引入神经波束形成器,有效提升了语音分离性能。
引用
@article{arxiv.2306.15942,
title = {Enhanced Neural Beamformer with Spatial Information for Target Speech Extraction},
author = {Aoqi Guo and Junnan Wu and Peng Gao and Wenbo Zhu and Qinwen Guo and Dazhi Gao and Yujun Wang},
journal= {arXiv preprint arXiv:2306.15942},
year = {2023}
}