分析说话人定位误差对用于自动语音识别的语音分离的影响
音频与语音处理
2019-10-25 v1
摘要
我们研究了在多说话人、多通道环境下说话人定位对语音识别系统性能的影响。给定说话人位置信息,语音分离分三个阶段执行。第一阶段,使用简单的延迟求和(DS)波束成形器增强来自该说话人位置的入射信号,随后利用神经网络估计对应于该定位说话人的时频掩码。该掩码用于计算二阶统计量并在第三阶段推导自适应波束成形器。我们生成了一个受广泛研究的WSJ0-2mix启发得到的多通道、多说话人、混响、含噪数据集,并依据词错误率(WER)研究所提流水线的性能。使用真实定位信息取得了平均29.4%的WER,而使用经GCC-PHAT估计的定位信息则取得42.4%的WER。说话人间的信号干扰比(SIR)对ASR性能影响更大,在SIR增加15 dB时相对降低WER达59%。相比之下,将空间距离增大至50°或以上仅相对改善WER 23%。
引用
@article{arxiv.1910.11114,
title = {Analyzing the impact of speaker localization errors on speech separation for automatic speech recognition},
author = {Sunit Sivasankaran and Emmaneul Vincent and Dominique Fohr},
journal= {arXiv preprint arXiv:1910.11114},
year = {2019}
}
备注
Submitted to ICASSP 2020