使用信息论相似性度量识别翻唱歌曲
信息检索
2015-05-19 v3 机器学习
机器学习
摘要
本文研究了量化音频信号之间相似性的方法,特别是用于翻唱歌曲检测的任务。我们考虑一种信息论方法,其中我们计算时间序列之间的成对可预测性度量。我们比较了基于量化音频特征的离散值方法和连续值方法。在离散情况下,我们提出了一种计算归一化压缩距离的方法,其中我们考虑了时间序列之间的相关性。在连续情况下,我们提出将基于信息的相似性度量计算为时间序列之间预测误差的统计量。我们在两个翻唱歌曲识别任务上评估了我们的方法,使用了一个包含300首爵士乐标准曲的数据集和百万歌曲数据集。对于两个数据集,我们观察到连续值方法优于离散值方法。我们考虑了基于字符串压缩和预测来估计归一化压缩距离(NCD)的方法,其中我们观察到,对于顺序压缩算法,我们提出的带对齐的归一化压缩距离(NCDA)比NCD的平均性能有所提高。最后,我们证明了连续值距离可以组合起来,以相对于基线方法提高性能。使用大规模过滤和细化方法,我们在百万歌曲数据集上展示了翻唱歌曲识别的最新性能。
引用
@article{arxiv.1407.2433,
title = {Identifying Cover Songs Using Information-Theoretic Measures of Similarity},
author = {Peter Foster and Simon Dixon and Anssi Klapuri},
journal= {arXiv preprint arXiv:1407.2433},
year = {2015}
}
备注
13 pages, 5 figures, 4 tables. v3: Accepted version