用于语音分离的低成本算法延迟深度聚类方法
声音
2019-02-20 v1 音频与语音处理
摘要
本文提出了一种针对说话人无关语音分离的深度聚类方法的低算法延迟适配方案。它由三部分组成:a) 使用长短期记忆(LSTM)网络替代原工作中使用的双向变体;b) 使用低延迟操作所需的短合成窗(此处为 8 ms);以及 c) 在音频混合信号开头使用缓冲器来估计对应于各组成说话人的聚类中心,随后利用这些中心分离信号其余部分中的说话人。缓冲器时长将作为初始化阶段,此后系统能够以 8 ms 的算法延迟运行。我们在华尔街日报(WSJ0)语料库的双说话人混合信号上评估了所提方法。我们观察到,在源失真比(SDR)方面,使用 LSTM 相比基线双向 LSTM 产生约低 1 dB 的 SDR。此外,使用 8 ms 合成窗替代 32 ms 相比基线使分离性能下降约 2.1 dB。最后,我们还报告了不同缓冲器时长下的分离性能,注意到即便缓冲器时长低至 300 ms 也能实现分离。
引用
@article{arxiv.1902.07033,
title = {Low-Latency Deep Clustering For Speech Separation},
author = {Shanshan Wang and Gaurav Naithani and Tuomas Virtanen},
journal= {arXiv preprint arXiv:1902.07033},
year = {2019}
}
备注
To appear in ICASSP 2019