中文

用于有监督单通道语音分离的端到端网络

音频与语音处理 2018-10-08 v1 机器学习 声音 信号处理

摘要

近年来,随着神经网络的开发与部署,单通道源分离算法的性能得到了极大提升。然而,许多此类网络仍基于混合信号的幅度谱图进行操作,并估计源幅度谱图以完成源分离。在本文中,我们将这些步骤解释为额外的神经网络层,并提出一种端到端源分离网络,该网络可直接对混合信号的原始波形进行操作,从而估计出分离后的语音波形。此外,我们还提出使用基于掩码的端到端分离网络,其联合优化掩码与混合波形的潜在表示。在我们的实验中,这些网络相比现有架构在分离性能上表现出显著提升。为训练这些端到端模型,我们研究了使用由波形上客观评价指标导出的复合代价函数。我们给出了主观试听测试结果,证明了基于掩码的端到端网络所带来的性能提升,并揭示了这些代价函数在端到端源分离中的表现规律。

关键词

引用

@article{arxiv.1810.02568,
  title  = {End-to-end Networks for Supervised Single-channel Speech Separation},
  author = {Shrikant Venkataramani and Paris Smaragdis},
  journal= {arXiv preprint arXiv:1810.02568},
  year   = {2018}
}