一种用于翻唱检测的Prototypical Triplet Loss
机器学习
2020-04-10 v2 声音
机器学习
摘要
自动翻唱检测——在音频数据集中查找某查询曲目的所有翻唱版本的任务——长期以来是音乐信息检索(MIR)界一个具有挑战性的理论问题。对于需要自动检测音频片段是否包含其曲库中音乐内容的音乐作曲者协会而言,它也成为了一种实际需求。在近期工作中,我们用卷积神经网络将每首曲目的主导旋律映射为嵌入向量,并训练以最小化翻唱对在嵌入空间中的距离,同时最大化非翻唱对的距离。我们特别表明,用足够多具有五个或以上翻唱版本的作品训练该模型可取得最先进结果。然而这并不反映真实用例,即音乐曲库通常包含零个或至多一到两个翻唱版本的作品。因此我们在此引入一个纳入这些约束的新测试集,并提出两项改进更严格条件下模型精度的贡献:以多音高表示替代主导旋律作为输入数据,并描述一种旨在改善翻唱聚类的新型 prototypical triplet loss。我们展示了这些改变在两大具体用例——大型数据集检索与现场歌曲识别——中显著改善了结果。
引用
@article{arxiv.1910.09862,
title = {A Prototypical Triplet Loss for Cover Detection},
author = {Guillaume Doras and Geoffroy Peeters},
journal= {arXiv preprint arXiv:1910.09862},
year = {2020}
}
备注
Corrections after reviewers comments. Correct erroneous figure 5 in original version