深度神经网络用于重叠说话人分离的实际适用性
机器学习
2019-12-20 v1 声音
音频与语音处理
机器学习
摘要
本文考察了两种基于深度学习的重叠说话人分离方法在真实场景中的适用性。首先,我们给出的实验表明这些方法适用于广泛的语言范围。进一步的实验表明,当未训练语言与已训练语言具有共同特征时,性能损失有限。其次,研究了这些方法如何处理真实背景噪声,并提出了一些改进以更好地应对这些干扰。将被考察的深度学习方法为深度聚类和深度吸引子网络。
引用
@article{arxiv.1912.09261,
title = {Practical applicability of deep neural networks for overlapping speaker separation},
author = {Pieter Appeltans and Jeroen Zegers and Hugo Van hamme},
journal= {arXiv preprint arXiv:1912.09261},
year = {2019}
}
备注
Interspeech 2019