中文

MMDenseLSTM:一种卷积与循环神经网络的高效组合用于音频源分离

声音 2018-05-30 v2 音频与语音处理

摘要

深度神经网络已成为音频源分离(ASS)不可或缺的技术。近期有报道称,一种称为 MMDenseNet 的 CNN 架构变体被成功用于解决估计源幅度的 ASS 问题,并在 DSD100 数据集上取得了最先进的结果。为进一步增强 MMDenseNet,我们在此提出一种新颖架构,将长短期记忆(LSTM)以多尺度方式与跳跃连接相整合,以高效建模音频语境中的长期结构。实验结果表明,所提方法优于 MMDenseNet、LSTM 以及两种网络的简单混合。所提模型的参数量与处理时间显著少于简单混合。此外,对于歌声分离任务,所提方法取得了比使用理想二值掩码更好的结果。

关键词

引用

@article{arxiv.1805.02410,
  title  = {MMDenseLSTM: An efficient combination of convolutional and recurrent neural networks for audio source separation},
  author = {Naoya Takahashi and Nabarun Goswami and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:1805.02410},
  year   = {2018}
}