深度可分离卷积与循环神经网络在单声道歌声分离中的对比
音频与语音处理
2020-07-08 v1 机器学习
声音
摘要
近期音乐源分离的方法几乎完全基于深度神经网络,大多采用循环神经网络(RNNs)。尽管 RNNs 在许多情况下处理序列优于其他类型的深度神经网络,但众所周知其在训练和并行化方面存在特定困难,尤其是在音乐源分离中常见的较长序列上。本文给出了一个用深度可分离(DWS)卷积替代 RNNs 的用例,DWS 卷积是典型卷积的轻量且更快的变体。我们聚焦于歌声分离,采用一种 RNN 架构,并将 RNNs 替换为 DWS 卷积(DWS-CNNs)。我们进行了消融研究,并利用信号到伪影比、信号到干扰比和信号到失真比这些标准指标,考察了 DWS-CNNs 的通道数与层数对其源分离性能的影响。结果表明,以 DWS-CNNs 替代 RNNs 分别带来 1.20、0.06、0.37 dB 的提升,而所用参数量仅为 RNN 架构的 20.57%。
引用
@article{arxiv.2007.02683,
title = {Depthwise Separable Convolutions Versus Recurrent Neural Networks for Monaural Singing Voice Separation},
author = {Pyry Pyykkönen and Styliannos I. Mimilakis and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2007.02683},
year = {2020}
}