中文

两步声源分离:在习得潜目标上训练

机器学习 2021-05-12 v2 计算与语言 声音 音频与语音处理 机器学习

摘要

本文提出一种通过深度神经网络进行源分离的两步训练流程。第一步,我们学习到潜空间的一种变换(及其逆变换),在该空间中基于 oracle 的掩蔽分离性能达到最优。第二步,我们在前述习得空间上训练分离模块。为此,我们还采用了一种在潜空间中生效的尺度不变信号失真比(SI-SDR)损失函数,并证明它在时域上构成 SI-SDR 的下界。我们进行了多项声音分离实验,表明相较于联合学习变换与分离模块的系统,该方法可获得更优性能。所提方法具有足够通用性,可应用于大类神经网络端到端分离系统。

关键词

引用

@article{arxiv.1910.09804,
  title  = {Two-Step Sound Source Separation: Training on Learned Latent Targets},
  author = {Efthymios Tzinis and Shrikant Venkataramani and Zhepei Wang and Cem Subakan and Paris Smaragdis},
  journal= {arXiv preprint arXiv:1910.09804},
  year   = {2021}
}

备注

Submitted to ICASSP 2020