中文

解决歌手识别中伴奏混淆因素的问题

声音 2020-02-18 v1 机器学习 多媒体 音频与语音处理

摘要

识别歌手是一项具有诸多应用的重要任务。然而,由于许多问题,该任务仍然具有挑战性。一个主要问题涉及音乐制作中与 vocals 混合的背景器乐音乐所带来的混淆因素。如果一位歌手仅在特定音乐语境(如流派)中演唱,歌手识别模型可能学会从歌曲的器乐部分提取与 vocal 无关的特征。因此当该歌手在未见过的语境中演唱时,模型无法很好泛化。在本文中,我们试图解决此问题。具体而言,我们采用 open-unmix(一种在源分离方面具有 SOTA 性能的开源工具)来分离音乐的 vocal 与器乐音轨。随后我们研究两种训练歌手识别模型的方法:仅从分离的 vocal 学习,或从增强数据集中学习,其中我们通过“打乱并重混”不同歌曲的分离 vocal 音轨与器乐音轨来人为使歌手在不同语境中演唱。我们还融入从 vocal 旋律轮廓学到的旋律特征以提升性能。在名为 artist20 的基准数据集上的评估结果表明,该数据增强方法大幅提高了歌手识别的准确率。

关键词

引用

@article{arxiv.2002.06817,
  title  = {Addressing the confounds of accompaniments in singer identification},
  author = {Tsung-Han Hsieh and Kai-Hsiang Cheng and Zhe-Cheng Fan and Yu-Ching Yang and Yi-Hsuan Yang},
  journal= {arXiv preprint arXiv:2002.06817},
  year   = {2020}
}