基于多分辨率卷积自编码器的原始多通道音频源分离
声音
2018-03-05 v1 计算机视觉与模式识别
机器学习
多媒体
摘要
有监督的多通道音频源分离需要从混合信号中提取有用的频谱、时域与空间特征。因此,许多现有系统的成功很大程度上依赖于训练所用特征的选择。在本工作中,我们引入一种新颖的多通道、多分辨率卷积自编码器神经网络,该网络直接在原始时域信号上工作,以确定适用于从立体声音乐中分离歌声的恰当多分辨率特征。我们的实验结果表明,所提方法能够实现多通道音频源分离,而无需手工设计特征或任何预处理、后处理。
引用
@article{arxiv.1803.00702,
title = {Raw Multi-Channel Audio Source Separation using Multi-Resolution Convolutional Auto-Encoders},
author = {Emad M. Grais and Dominic Ward and Mark D. Plumbley},
journal= {arXiv preprint arXiv:1803.00702},
year = {2018}
}