中文

说话人与方向推断的双通道语音分离

声音 2021-02-09 v1 音频与语音处理

摘要

大多数语音分离方法试图同时分离所有通道源,对于输入声音数量通常不确定甚至动态变化的真实场景,其泛化能力仍远不足够。本工作中,我们借鉴双耳听觉注意的思想,提出一种说话人与方向推断的语音分离网络(称为SDNet)以解决鸡尾酒会问题。具体而言,我们的SDNet首先从场景混合中按顺序解析出带有各自说话人与方向特征的感知表示,随后利用这些感知表示去注意对应的各路语音。我们的模型借助空间特征生成更精确的感知表示,并成功处理了源数量未知及输出选择的问题。在标准完全重叠语音分离基准WSJ0-2mix、WSJ0-3mix与WSJ0-2&3mix上的实验显示了有效性,我们的方法在无混响设置下分别实现了25.31 dB、17.26 dB与21.56 dB的SDR提升。我们的代码将发布于https://github.com/aispeech-lab/SDNet。

关键词

引用

@article{arxiv.2102.04056,
  title  = {Speaker and Direction Inferred Dual-channel Speech Separation},
  author = {Chenxing Li and Jiaming Xu and Nima Mesgarani and Bo Xu},
  journal= {arXiv preprint arXiv:2102.04056},
  year   = {2021}
}

备注

Accepted by ICASSP 2021