基于多损失训练与人工数据集的嘻哈音乐样本自动识别
声音
2025-02-11 v1 机器学习
音频与语音处理
摘要
采样是指在新作品中重复使用来自其他来源的录制音乐或声音的做法, 在嘻哈乐和说唱乐等流行音乐流派中很常见。众多服务涌现出来,允许用户识别样本与包含它们的歌曲之间的联系,以增强音乐发现。设计能够自动执行相同任务的系统具有挑战性,因为样本常常会被音频效果(如升调和时移)所改变,并且可能只有几秒钟长。本任务的进展甚少,且由于训练数据的可得性有限而受到进一步阻碍。本文展示了,一个在人工数据集上训练的卷积神经网络可以识别商业嘻哈音乐中出现的真实世界样本。我们从几个非商业音乐录音的数据库中提取人声、和声和鼓点元素,并训练模型对这些元素的子集进行指纹化,以识别原始音频经变换后的版本。我们采用联合分类和度量学习损失函数优化模型,并表明它在真实世界的样本采样实例上实现了比使用声学地标进行指纹识别系统提高了13%的精度,并且能够识别同时经历升调和时移的样本。我们还表明,对于我们测试的五分之一的商业音乐录音, our 模型能够将样本的位置定位到五秒钟以内。
引用
@article{arxiv.2502.06364,
title = {Automatic Identification of Samples in Hip-Hop Music via Multi-Loss Training and an Artificial Dataset},
author = {Huw Cheston and Jan Van Balen and Simon Durand},
journal= {arXiv preprint arXiv:2502.06364},
year = {2025}
}
备注
17 pages, 6 figures