中文

基于膨胀稠密 U-Net 多尺度学习的音频源分离

机器学习 2019-04-09 v1 声音 音频与语音处理 机器学习

摘要

现代音频源分离技术依赖于在混合录音上优化序列模型架构(如 1D-CNNs)以很好地泛化到未见的混合信号。具体而言,近期的焦点在于基于时域的架构,如 Wave-U-Net,其通过提取多尺度特征来利用时间上下文。然而,这些架构中特征提取过程的最优性尚未得到充分研究。本文中,我们考察并推荐了关键性的架构改动,以构建最优的多尺度特征提取过程。为此,我们用自适应膨胀卷积替换常规 11-D 卷积,后者凭借使用大时间感受野具有捕获更多上下文的先天能力。我们还研究了稠密连接对提取过程的影响,其促进特征复用与更好的梯度流动。U-Net 架构下采样与上采样路径之间的稠密连接捕获多分辨率信息,从而改进时间建模。我们在 MUSDB 测试数据集上评估所提方法。除提供优于当前最优(state-of-the-art)的性能外,我们还就不同架构选择对数据驱动源分离复杂方案的影响提供了见解。

关键词

引用

@article{arxiv.1904.04161,
  title  = {Audio Source Separation via Multi-Scale Learning with Dilated Dense U-Nets},
  author = {Vivek Sivaraman Narayanaswamy and Sameeksha Katoch and Jayaraman J. Thiagarajan and Huan Song and Andreas Spanias},
  journal= {arXiv preprint arXiv:1904.04161},
  year   = {2019}
}