中文

利用语句级与帧级参考信号的多阶段说话人提取

音频与语音处理 2021-04-05 v2 机器学习

摘要

说话人提取需要目标说话人的一段样本语音作为参考。然而,使用长语音注册说话人并不现实。我们提出了一种多阶段执行的说话人提取技术,以充分利用短参考语音样本。早期阶段提取出的语音被用作后期阶段的参考语音。我们首次使用帧级序列语音嵌入作为目标说话人的参考。这有别于传统的基于语句的说话人嵌入参考。此外,提出了一种信号融合方案,以自动学习的权重将多尺度的解码信号进行组合。在WSJ0-2mix及其带噪版本(WHAM! 和 WHAMR!)上的实验表明,SpEx++ 持续优于其他最先进的基线。

关键词

引用

@article{arxiv.2011.09624,
  title  = {Multi-stage Speaker Extraction with Utterance and Frame-Level Reference Signals},
  author = {Meng Ge and Chenglin Xu and Longbiao Wang and Eng Siong Chng and Jianwu Dang and Haizhou Li},
  journal= {arXiv preprint arXiv:2011.09624},
  year   = {2021}
}

备注

Accepted in ICASSP 2021