使用卷积神经网络的音频翻唱歌曲识别
声音
2020-10-29 v2 人工智能
机器学习
音频与语音处理
摘要
在本文中,我们提出了一种使用 CNN(卷积神经网络)进行翻唱歌曲识别的新方法。以往大多数研究从一对歌曲中提取刻画翻唱歌曲关系的特征向量,并用其计算两首歌曲之间的(不)相似度。基于翻唱歌曲之间存在有意义模式且可被学习的观察,我们将翻唱歌曲识别问题重新表述于一个机器学习框架中。为此,我们首先构建 CNN,以由一对歌曲生成的交叉相似度矩阵作为输入。然后我们构造由翻唱歌曲对和非翻唱歌曲对组成的数据集,分别用作正训练样本和负训练样本。训练好的 CNN 在给定由任意两段音乐生成的交叉相似度矩阵时,输出其处于翻唱歌曲关系的概率,并通过该概率上的排序来识别翻唱歌曲。实验结果表明,所提算法取得了优于或与最先进水平(SOTA)相当的性能。
引用
@article{arxiv.1712.00166,
title = {Audio Cover Song Identification using Convolutional Neural Network},
author = {Sungkyun Chang and Juheon Lee and Sang Keun Choe and Kyogu Lee},
journal= {arXiv preprint arXiv:1712.00166},
year = {2020}
}
备注
NIPS 2017 Workshop on Machine Learning for Audio (ML4A), Long Beach, CA, USA