深度聚类与传统网络用于音乐分离:更强联手
机器学习
2017-11-30 v2 机器学习
声音
摘要
深度聚类是首个处理具有同类多源及任意源数的通用音频分离场景的方法,在说话人无关的语音分离任务中表现令人印象深刻。然而,其在如音乐源分离等其他挑战性情境中的有效性鲜有知晓。与直接估计源信号的传统网络相反,深度聚类为每个时频单元生成嵌入,并通过在嵌入空间中对单元聚类来分离源。我们表明,在歌声分离任务中,深度聚类在匹配与不匹配条件下均优于传统网络,尽管传统网络具有端到端训练以最佳信号近似的优势,这大概是因为其更灵活的目标带来了更好的正则化。由于深度聚类与传统网络架构的优势似乎互补,我们探索将它们结合在单一混合网络中,通过类似多任务学习的方法训练。值得注意的是,该组合显著优于其任一组成部分。
引用
@article{arxiv.1611.06265,
title = {Deep Clustering and Conventional Networks for Music Separation: Stronger Together},
author = {Yi Luo and Zhuo Chen and John R. Hershey and Jonathan Le Roux and Nima Mesgarani},
journal= {arXiv preprint arXiv:1611.06265},
year = {2017}
}
备注
Published in ICASSP 2017