面向未知说话人数的由粗到细递归语音分离
声音
2022-03-31 v1 机器学习
音频与语音处理
摘要
绝大多数语音分离方法都假设说话人数目事先已知,因此它们仅适用于特定说话人数。相比之下,更具现实性和挑战性的任务是对说话人数未知的混合物进行分离。本文将未知说话人数的语音分离建模为一个多遍源提取问题,并提出了一种由粗到细的递归语音分离方法。该方法包含两个阶段,即递归线索提取与目标说话人提取。递归线索提取阶段通过监测混合物中的统计量来确定需要执行多少次计算迭代,并输出一个粗略线索语音。随着递归迭代次数的增加,提取出的语音与剩余部分中最终会累积失真。因此,在第二阶段,我们使用目标说话人提取网络,基于粗略目标线索与原始无失真混合物来提取精细语音。实验表明,所提方法在具有不同说话人数的 WSJ0 数据集上取得了最先进的性能。此外,它对未见过的较大量说话人数也具有良好的泛化能力。
引用
@article{arxiv.2203.16054,
title = {Coarse-to-Fine Recursive Speech Separation for Unknown Number of Speakers},
author = {Zhenhao Jin and Xiang Hao and Xiangdong Su},
journal= {arXiv preprint arXiv:2203.16054},
year = {2022}
}