通过多波束深度吸引子网络破解鸡尾酒会问题
声音
2018-03-30 v1 音频与语音处理
摘要
尽管神经网络方法在单通道语音分离,或更一般地说鸡尾酒会问题方面取得了显著进展,但它们对复杂混合物的性能仍然不能令人满意。在这项工作中,我们提出了一种用于多说话人分离的新型多通道框架。在所提出的模型中,输入的多通道混合信号首先使用固定波束模式转换为一组波束成形信号。对于这种波束成形,我们建议使用差分波束成形器,因为它们更适合语音分离。然后,每个波束成形信号被送入单通道锚定深度吸引子网络以生成分离信号。并通过后处理选择每个波束的分离输出以获得最终分离结果。为了评估所提出的系统,我们创建了一个包含 2、3 或 4 个说话人混合物的具有挑战性的数据集。我们的结果表明,所提出的系统在很大程度上改进了语音分离领域的现有技术,对于 4、3 和 2 个重叠说话人混合物,分别实现了 11.5 dB、11.76 dB 和 11.02 dB 的平均信号失真比改善,这与使用先验位置、源和噪声信息的最小方差无失真响应波束成形器的性能相当。我们还在分离后的语音上运行了使用纯净声学模型训练的语音识别,对于 4、3 和 2 个说话人的完全重叠语音,分别实现了 45.76%、59.40% 和 62.80% 的相对词错率(WER)降低。使用远讲声学模型时,WER 进一步降低。
引用
@article{arxiv.1803.10924,
title = {Cracking the cocktail party problem by multi-beam deep attractor network},
author = {Zhuo Chen and Jinyu Li and Xiong Xiao and Takuya Yoshioka and Huaming Wang and Zhenghao Wang and Yifan Gong},
journal= {arXiv preprint arXiv:1803.10924},
year = {2018}
}