用于音乐源分离的谱图特征损失
声音
2019-06-28 v3 机器学习
音频与语音处理
机器学习
摘要
本文研究基于深度学习的音乐源分离,并探索使用一种替代标准谱图像素级L2损失的损失函数进行模型训练。我们的主要贡献在于证明,添加一个由VGG网络从谱图中提取的高层特征损失项,相较于纯粹的像素级损失能够提升分离质量。我们在MMDenseNet(该任务上最先进的深度学习模型)的语境下展示了这一改进,用于从musdb18数据库中的歌曲提取鼓声和人声,涵盖了广泛的西方音乐流派。我们相信这一发现可推广并应用于音频领域中更广泛的基于机器学习的系统。
引用
@article{arxiv.1901.05061,
title = {Spectrogram Feature Losses for Music Source Separation},
author = {Abhimanyu Sahai and Romann Weber and Brian McWilliams},
journal= {arXiv preprint arXiv:1901.05061},
year = {2019}
}
备注
Accepted for presentation at the 27th European Signal Processing Conference (EUSIPCO 2019)