面向位置不确定性的多通道语音分离三维神经波束形成
声音
2023-02-28 v1 音频与语音处理
摘要
利用说话人方向信息的多通道语音分离相比盲语音分离已展现出显著增益。然而,它存在两个局限。第一,当两路声音的到达方向接近时,性能出现明显退化。第二,结果高度依赖于对说话人方向的精确估计。为克服这些问题,本文提出三维特征及相应的三维神经波束形成器用于多通道语音分离。以往该领域的工作在两个重要方向上得到拓展。第一,传统的 1D 方向波束图被推广至 3D,使模型能够从三维空间中任意目标区域提取语音,从而令方向相近但仰角或距离不同的说话人变得可分离。第二,为处理说话人位置不确定性,将先前提出的空间特征扩展为一种新三维区域特征。所提出的三维区域特征与三维神经波束形成器在车载场景下进行了评估。实验结果表明,三维特征与三维波束形成器的结合可达到以真值说话人位置为输入的分离模型相当的性能。
引用
@article{arxiv.2302.13462,
title = {3D Neural Beamforming for Multi-channel Speech Separation Against Location Uncertainty},
author = {Rongzhi Gu and Shi-Xiong Zhang and Dong Yu},
journal= {arXiv preprint arXiv:2302.13462},
year = {2023}
}