SLOGD:基于说话人定位引导缩减的语音分离方法
音频与语音处理
2019-10-25 v1
摘要
语音分离是从音频记录中分离多个说话人的过程。在本工作中,我们提出使用说话人定位引导缩减(SLOGD)方法迭代地分离声源。在每次迭代中,我们首先估计说话人的位置,并用它来估计对应于该定位说话人的掩码。在估计下一个声源的位置和掩码之前,将估计出的源从混合信号中移除。实验在广为研究的 WSJ-2MIX 数据集的混响、含噪多通道版本上进行,使用词错误率(WER)作为度量。所提出的方法达到了 % 的 WER,相对于无分离系统有 % 的相对提升,相对于 Conv-TasNet 有 % 的相对提升。
引用
@article{arxiv.1910.11131,
title = {SLOGD: Speaker LOcation Guided Deflation approach to speech separation},
author = {Sunit Sivasankaran and Emmanuel Vincent and Dominique Fohr},
journal= {arXiv preprint arXiv:1910.11131},
year = {2019}
}
备注
Submitted to ICASSP 2020