中文

基于多分辨率卷积自编码器的原始多通道音频源分离

声音 2018-03-05 v1 计算机视觉与模式识别 机器学习 多媒体

摘要

有监督的多通道音频源分离需要从混合信号中提取有用的频谱、时域与空间特征。因此,许多现有系统的成功很大程度上依赖于训练所用特征的选择。在本工作中,我们引入一种新颖的多通道、多分辨率卷积自编码器神经网络,该网络直接在原始时域信号上工作,以确定适用于从立体声音乐中分离歌声的恰当多分辨率特征。我们的实验结果表明,所提方法能够实现多通道音频源分离,而无需手工设计特征或任何预处理、后处理。

关键词

引用

@article{arxiv.1803.00702,
  title  = {Raw Multi-Channel Audio Source Separation using Multi-Resolution Convolutional Auto-Encoders},
  author = {Emad M. Grais and Dominic Ward and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:1803.00702},
  year   = {2018}
}