Wave-U-Net:一种用于端到端音频源分离的多尺度神经网络
声音
2018-06-11 v1 音频与语音处理
机器学习
摘要
音频源分离模型通常在幅度谱上操作,这忽略了相位信息并使分离性能依赖于谱前端超参数。因此,我们研究时域中的端到端源分离,其允许对相位信息建模并避免固定的谱变换。由于音频采样率高,在样本级别采用长时域输入上下文是困难的,但由于长程时间相关性,这对于高质量分离结果是必需的。在此背景下,我们提出Wave-U-Net,一种将U-Net适配到一维时域的网络,其通过重复对特征图重采样以在不同时间尺度上计算并组合特征。我们引入了进一步的架构改进,包括强制源可加性的输出层、一种上采样技术以及用于减少输出伪影的上下文感知预测框架。针对歌声分离的 experiments 表明,在给定相同数据的情况下,我们的架构取得了与最先进的基于谱图的U-Net架构相当的performance。最后,我们揭示了当前使用的SDR评估指标中存在的离群值问题,并建议报告基于秩的统计量以缓解该问题。
引用
@article{arxiv.1806.03185,
title = {Wave-U-Net: A Multi-Scale Neural Network for End-to-End Audio Source Separation},
author = {Daniel Stoller and Sebastian Ewert and Simon Dixon},
journal= {arXiv preprint arXiv:1806.03185},
year = {2018}
}
备注
7 pages (1 for references), 4 figures, 3 tables. Appearing in the proceedings of the 19th International Society for Music Information Retrieval Conference (ISMIR 2018) (camera-ready version). Implementation available at https://github.com/f90/Wave-U-Net