利用语句级与帧级参考信号的多阶段说话人提取
音频与语音处理
2021-04-05 v2 机器学习
摘要
说话人提取需要目标说话人的一段样本语音作为参考。然而,使用长语音注册说话人并不现实。我们提出了一种多阶段执行的说话人提取技术,以充分利用短参考语音样本。早期阶段提取出的语音被用作后期阶段的参考语音。我们首次使用帧级序列语音嵌入作为目标说话人的参考。这有别于传统的基于语句的说话人嵌入参考。此外,提出了一种信号融合方案,以自动学习的权重将多尺度的解码信号进行组合。在WSJ0-2mix及其带噪版本(WHAM! 和 WHAMR!)上的实验表明,SpEx++ 持续优于其他最先进的基线。
引用
@article{arxiv.2011.09624,
title = {Multi-stage Speaker Extraction with Utterance and Frame-Level Reference Signals},
author = {Meng Ge and Chenglin Xu and Longbiao Wang and Eng Siong Chng and Jianwu Dang and Haizhou Li},
journal= {arXiv preprint arXiv:2011.09624},
year = {2021}
}
备注
Accepted in ICASSP 2021