中文

Phasebook 及其伙伴:利用离散表示进行源分离

声音 2019-06-26 v2 计算与语言 机器学习 音频与语音处理 机器学习

摘要

基于深度学习的语音增强与源分离系统近期达到了前所未有的质量水平,性能正触及新的天花板。多数系统依赖于通过对混合信号的时频表示施加实值掩码来估计目标源的幅度。此类方法的一个限制因素是缺乏相位估计:在重建估计的时域信号时最常使用混合信号的相位。在此,我们提出“magbook”、“phasebook”和“combook”,三种基于离散表示的新层类型,可用于估计复值时频掩码。Magbook 层扩展了经典的 sigmoid 单元以及近期引入的用于基于掩码的幅度估计的凸 softmax 激活。Phasebook 层使用类似结构来给出相位掩码的估计,且不受相位卷绕问题影响。Combook 层是 magbook-phasebook 组合的替代方案,直接估计复值掩码。我们给出了涉及这些表示的各种训练与推断方案,并特别说明了如何将其纳入端到端学习框架。我们还给出了一个预言机研究,以评估使用离散相位表示的各种掩码类型的性能上界。我们在 wsj0-2mix 数据集上评估了所提方法,该数据集是单通道说话人无关说话人分离的被广泛研究的语料库,在无需额外相位重建步骤的情况下匹配了最先进的基于掩码方法的性能。

关键词

引用

@article{arxiv.1810.01395,
  title  = {Phasebook and Friends: Leveraging Discrete Representations for Source Separation},
  author = {Jonathan Le Roux and Gordon Wichern and Shinji Watanabe and Andy Sarroff and John R. Hershey},
  journal= {arXiv preprint arXiv:1810.01395},
  year   = {2019}
}