中文

考察去噪自编码器在歌声分离中的映射函数

音频与语音处理 2019-10-22 v2 机器学习 声音

摘要

本工作的目标是研究基于神经网络的歌声分离方法从数据中学习了什么。我们考察基于去噪自编码器(DAE)模型且以混合幅度谱为条件的神经网络的映射函数。为近似这些映射函数,我们提出一种受知识蒸馏启发的算法,称为神经耦合算法(NCA)。NCA产生一个矩阵,表达从混合信号到目标源幅度信息的映射。利用NCA,我们考察了音乐源分离中三种基本DAE模型的映射函数:一种具有单层编码器与解码器,一种具有多层编码器与单层解码器,以及一种使用跳跃滤波连接(SF)且单层编码与解码的模型。我们首先用真实数据训练这些模型,以从相应混合信号中估计歌声幅度谱。然后我们使用优化后的模型并将测试频谱数据作为NCA的输入。我们的实验结果表明,基于DAE模型的方法学习到标量滤波算子,在其相应映射函数中呈现主导性的对角结构,限制了对音乐数据频间结构的利用。相比之下,跳跃滤波连接被证明可辅助DAE模型学习利用更丰富频间结构的滤波算子。

关键词

引用

@article{arxiv.1904.06157,
  title  = {Examining the Mapping Functions of Denoising Autoencoders in Singing Voice Separation},
  author = {Stylianos Ioannis Mimilakis and Konstantinos Drossos and Estefanía Cano and Gerald Schuller},
  journal= {arXiv preprint arXiv:1904.06157},
  year   = {2019}
}