中文

Sams-Net:一种基于切片注意力的音乐源分离神经网络

音频与语音处理 2020-05-20 v4 信息检索 机器学习 声音

摘要

基于 CNN 或 LSTM 并以频谱图或波形为输入的模型常用于基于深度学习的音频源分离。本文中,我们提出一种在频谱图域上面向音乐源分离任务的基于切片注意力的神经网络(Sams-Net)。它利用多头注意力机制实现频谱特征交互,相比 LSTM 和 CNN 分别实现了更易并行计算以及更大的感受野。在 MUSDB18 数据集上的实验结果表明,所提方法以更少的参数优于大多数 SOTA 的基于 DNN 的方法。

关键词

引用

@article{arxiv.1909.05746,
  title  = {Sams-Net: A Sliced Attention-based Neural Network for Music Source Separation},
  author = {Tingle Li and Jiawei Chen and Haowen Hou and Ming Li},
  journal= {arXiv preprint arXiv:1909.05746},
  year   = {2020}
}

备注

Submitted to Interspeech 2020