面向未知说话人人数的递归语音分离
声音
2019-09-04 v3 音频与语音处理
摘要
本文提出一种针对未知说话人人数的单通道说话人无关多说话人语音分离方法。与先前假设说话人数已知且语音分离模型特定于说话人数的工作不同,我们提出的方法通过使用单一模型递归地分离出一位说话人,可应用于具有不同说话人数的情形。为使分离模型可递归应用,我们提出一端与其余排列不变训练(OR-PIT)。在 WSJ0-2mix 和 WSJ0-3mix 数据集上的评估表明,我们提出的方法以单一模型在两说话人和三说话人混合上取得了最先进(SOTA)结果。此外,同一模型可分离四说话人混合,而这是训练期间从未见过的。我们进一步提出在递归分离过程中检测混合中的说话人人数,并表明该方法比使用基于深度神经网络的分类器提前检测能更准确地估计说话人人数。
引用
@article{arxiv.1904.03065,
title = {Recursive speech separation for unknown number of speakers},
author = {Naoya Takahashi and Sudarsanam Parthasaarathy and Nabarun Goswami and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:1904.03065},
year = {2019}
}
备注
Interspeech 2019 (oral)