两步声源分离:在习得潜目标上训练
机器学习
2021-05-12 v2 计算与语言
声音
音频与语音处理
机器学习
摘要
本文提出一种通过深度神经网络进行源分离的两步训练流程。第一步,我们学习到潜空间的一种变换(及其逆变换),在该空间中基于 oracle 的掩蔽分离性能达到最优。第二步,我们在前述习得空间上训练分离模块。为此,我们还采用了一种在潜空间中生效的尺度不变信号失真比(SI-SDR)损失函数,并证明它在时域上构成 SI-SDR 的下界。我们进行了多项声音分离实验,表明相较于联合学习变换与分离模块的系统,该方法可获得更优性能。所提方法具有足够通用性,可应用于大类神经网络端到端分离系统。
引用
@article{arxiv.1910.09804,
title = {Two-Step Sound Source Separation: Training on Learned Latent Targets},
author = {Efthymios Tzinis and Shrikant Venkataramani and Zhepei Wang and Cem Subakan and Paris Smaragdis},
journal= {arXiv preprint arXiv:1910.09804},
year = {2021}
}
备注
Submitted to ICASSP 2020