ByteCover:通过多损失训练的翻唱歌曲识别
声音
2021-04-26 v2 机器学习
音频与语音处理
摘要
我们在本文中提出 ByteCover,这是一种用于翻唱歌曲识别(CSI)的新特征学习方法。ByteCover 基于经典的 ResNet 模型构建,并设计了两项主要改进以进一步增强模型在 CSI 上的能力。在第一项改进中,我们引入实例归一化(IN)与批归一化(BN)的集成来构建 IBN 块,其是我们 ResNet-IBN 模型的主要组成部分。在 IBN 块的帮助下,我们的 CSI 模型能够学习对调性、速度、音色和流派等音乐属性变化不变的特征,同时保留版本信息。在第二项改进中,我们采用 BNNeck 方法以实现多损失训练,并鼓励我们的方法联合优化分类损失与三元组损失,由此可同时保证翻唱歌曲的类间判别性与类内紧凑性。一组实验证明了 ByteCover 在多个数据集上的有效性与高效性,且在 Da-TACOS 数据集上,ByteCover 比最佳竞争系统高出 20.9%。
引用
@article{arxiv.2010.14022,
title = {ByteCover: Cover Song Identification via Multi-Loss Training},
author = {Xingjian Du and Zhesong Yu and Bilei Zhu and Xiaoou Chen and Zejun Ma},
journal= {arXiv preprint arXiv:2010.14022},
year = {2021}
}