从原始听觉分组原则引导深度音乐分离
声音
2019-10-25 v1 机器学习
音频与语音处理
机器学习
摘要
将音频场景(如鸡尾酒会)分离为有意义的组成成分是计算机听觉的核心任务。深度网络是最先进的方法。它们在由孤立声源录音合成的音频混合上训练,从而已知分离的 ground truth。然而,绝大多数可用音频并非孤立的。大脑使用独立于任何特定声源特征的原始线索来对音频场景进行初始分割。我们提出了一种利用多个原始线索在无 ground truth 情况下引导深度音乐声源分离模型的方法。我们将该方法应用于在来自 YouTube 的大量无标签音乐录音上训练网络,以分离人声与伴奏,无需 ground truth 孤立声源或人工训练混合。
引用
@article{arxiv.1910.11133,
title = {Bootstrapping deep music separation from primitive auditory grouping principles},
author = {Prem Seetharaman and Gordon Wichern and Jonathan Le Roux and Bryan Pardo},
journal= {arXiv preprint arXiv:1910.11133},
year = {2019}
}