基于深度聚类的单通道多说话人分离
机器学习
2016-07-11 v1 声音
机器学习
摘要
深度聚类是一种新近引入的深度学习架构,其使用判别训练的嵌入作为聚类的基础。它最近被应用于谱图分割,在说话人无关的多说话人分离上取得了令人印象深刻的结果。在本文中,我们通过一个端到端信号近似目标扩展了基线系统,该目标极大提升了在具有挑战性的语音分离上的性能。我们首先通过结合更好的正则化、更大的时间上下文和更深的架构,显著改进了基线系统性能,最终在双说话人分离上相较 6.0 dB 的基线实现了信号失真比 (SDR) 整体 10.3 dB 的提升,以及在三说话人分离上 7.1 dB 的 SDR 提升。随后我们扩展模型以加入一个增强层来优化信号估计,并通过聚类与增强两个阶段执行端到端训练以最大化信号保真度。我们使用自动语音识别评估了结果。新的信号近似目标结合端到端训练产生了前所未有的性能,将词错误率 (WER) 从 89.1% 降低到 30.8%。这代表了向解决鸡尾酒会问题迈进的重要进展。
引用
@article{arxiv.1607.02173,
title = {Single-Channel Multi-Speaker Separation using Deep Clustering},
author = {Yusuf Isik and Jonathan Le Roux and Zhuo Chen and Shinji Watanabe and John R. Hershey},
journal= {arXiv preprint arXiv:1607.02173},
year = {2016}
}