中文

WildMix数据集与用于单声道音频源分离的谱-时域Transformer模型

机器学习 2019-11-25 v1 声音 音频与语音处理 机器学习

摘要

单声道音频源分离是机器学习中一个具有挑战性的研究领域。在该领域中,给定一个包含多个音频源的混合信号,期望模型将混合信号分离为孤立的原子源。在本文中,我们首先引入一个名为WildMix的用于单声道源分离的挑战性新数据集。WildMix的设计旨在将源分离的边界扩展到该领域以往数据集所允许的范围之外。它包含来自25个不同声音类别的多样化真实场景录音,并使用任意组合策略相互混合。源分离通常需要在时域和频域中建模长程依赖关系。为此,我们引入了一种名为谱-时域Transformer(Spectro-Temporal Transformer, STT)的基于Transformer的新模型。STT利用一种专门的编码器,称为谱-时域编码器(Spectro-Temporal Encoder, STE)。STE使用自注意力机制突出混合信号中各个源的时域和频域分量,随后以分层方式将它们分离。在我们的实验中,STT在具有挑战性的WildMix数据集上迅速优于各种先前的单声道源分离基线。

关键词

引用

@article{arxiv.1911.09783,
  title  = {WildMix Dataset and Spectro-Temporal Transformer Model for Monoaural Audio Source Separation},
  author = {Amir Zadeh and Tianjun Ma and Soujanya Poria and Louis-Philippe Morency},
  journal= {arXiv preprint arXiv:1911.09783},
  year   = {2019}
}