中文

利用深度嵌入特征进行单通道语音分离的判别学习

声音 2019-07-24 v1 机器学习 音频与语音处理

摘要

深度聚类(DC)与话语级置换不变训练(uPIT)已被证明在说话人无关语音分离中颇具前景。DC 通常表述为两步过程:嵌入学习与嵌入聚类,这导致分离流程复杂,且对实际分离目标的直接优化存在巨大障碍。至于 uPIT,其仅最小化具有最低均方误差的所选置换,并未将其与其他置换区分。本文中,我们提出一种利用深度嵌入特征的说话人无关语音分离判别学习方法。首先,训练 DC 网络提取深度嵌入特征,其包含各源信息且在区分各目标说话人上具有优势。随后将这些特征作为 uPIT 输入以直接分离不同源。最后,联合训练 uPIT 与 DC,直接优化实际分离目标。此外,为最大化各置换间距离,应用判别学习微调整体模型。我们在 WSJ0-2mix 数据集上开展实验。实验结果表明,所提模型在说话人无关语音分离上取得了优于 DC 与 uPIT 的性能。

关键词

引用

@article{arxiv.1907.09884,
  title  = {Discriminative Learning for Monaural Speech Separation Using Deep Embedding Features},
  author = {Cunhang Fan and Bin Liu and Jianhua Tao and Jiangyan Yi and Zhengqi Wen},
  journal= {arXiv preprint arXiv:1907.09884},
  year   = {2019}
}

备注

5 pages, 1 figure, accepted by INTERSPEECH 2019