中文

一种用于缓解时域目标说话人提取过度抑制的混合连续性损失

音频与语音处理 2022-06-22 v2 声音

摘要

说话人提取算法从包含干扰语音与背景噪声的混合语音中提取目标语音。该提取过程有时会过度抑制所提取的目标语音,不仅在听感上产生伪影,也损害下游自动语音识别算法的性能。我们提出一种用于时域说话人提取算法的混合连续性损失函数以解决过度抑制问题。在用于优越信号质量的波形级损失(即 SI-SDR)之上,我们在频域引入多分辨率 delta 谱损失,以确保提取语音信号的连续性,从而缓解过度抑制。我们在 YouTube LRS2-BBC 数据集上使用时域视听说话人提取算法检验了该混合连续性损失函数。实验结果表明,所提损失函数在干净与含噪双说话人混合条件下均减少了过度抑制并改善了语音识别的词错误率,且不损害重建语音质量。

关键词

引用

@article{arxiv.2203.16843,
  title  = {A Hybrid Continuity Loss to Reduce Over-Suppression for Time-domain Target Speaker Extraction},
  author = {Zexu Pan and Meng Ge and Haizhou Li},
  journal= {arXiv preprint arXiv:2203.16843},
  year   = {2022}
}

备注

Accepted by Interspeech2022