分而治之:一种用于说话人无关单通道语音分离的深层CASA方法
声音
2019-04-26 v1 机器学习
音频与语音处理
摘要
我们从深度学习和计算听觉场景分析(CASA)的角度解决说话人无关的单通道语音分离问题。具体而言,我们将多说话人分离任务分解为同时分组和顺序分组两个阶段。首先在每个时间帧内通过置换不变训练的神经网络分离不同说话人的频谱,完成同时分组。在第二阶段,通过聚类网络将帧级分离出的频谱顺序分组到不同说话人。所提出的深层CASA方法依次优化帧级分离与说话人跟踪,并在两项任务上均取得优异结果。在基准WSJ0-2mix数据库上的实验结果表明,新方法以较小的模型规模达到了当前最优(state-of-the-art)结果。
引用
@article{arxiv.1904.11148,
title = {Divide and Conquer: A Deep CASA Approach to Talker-independent Monaural Speaker Separation},
author = {Yuzhou Liu and DeLiang Wang},
journal= {arXiv preprint arXiv:1904.11148},
year = {2019}
}
备注
10 pages, 5 figures