SAGRNN:用于双耳说话人分离并保留双耳线索的自注意力门控 RNN
音频与语音处理
2021-02-03 v2 声音
摘要
大多数现有的基于深度学习的双耳说话人分离系统侧重于为每个目标说话人产生单声道估计,因此不保留双耳线索,而双耳线索对于人类听者进行声源定位与侧向化至关重要。在本研究中,我们处理说话人无关的、在估计的双耳信号中保留双耳线索的双耳说话人分离问题。具体而言,我们通过额外引入自注意力机制与密集连接,扩展了新近开发的用于单声道分离的门控循环神经网络。我们开发了一个端到端多输入多输出系统,直接将从混合信号的双耳波形映射到各语音信号的双耳波形。实验结果表明,我们提出的方法比近期的双耳分离方法取得了显著更好的分离性能。此外,我们的方法有效保留了双耳线索,从而提高了声源定位的准确性。
引用
@article{arxiv.2009.01381,
title = {SAGRNN: Self-Attentive Gated RNN for Binaural Speaker Separation with Interaural Cue Preservation},
author = {Ke Tan and Buye Xu and Anurag Kumar and Eliya Nachmani and Yossi Adi},
journal= {arXiv preprint arXiv:2009.01381},
year = {2021}
}
备注
5 pages, accepted by IEEE Signal Processing Letters