少即是多:通过嵌入蒸馏实现更快更好的音乐版本识别
声音
2020-10-08 v1 机器学习
音频与语音处理
摘要
版本识别系统旨在检测同一底层音乐作品(泛称翻唱歌曲)的不同演绎。通过学习将整段录音编码为普通向量嵌入,近期系统在缩小准确性与可扩展性之间的差距方面取得了显著进展,而这一差距近二十年来一直是关键挑战。在本工作中,我们提出通过采用一组减少预训练最先进模型嵌入维度的数据蒸馏技术来进一步缩小这一差距。我们比较了广泛的技术并提出了新技术,从经典降维到更复杂的蒸馏方案。借助这些技术,我们获得了小 99% 的嵌入,且准确率提升了高达 3%。如此小的嵌入对检索时间有重要影响,甚至可使真实世界系统在独立笔记本电脑上实用成为可能。
引用
@article{arxiv.2010.03284,
title = {Less is more: Faster and better music version identification with embedding distillation},
author = {Furkan Yesiler and Joan Serrà and Emilia Gómez},
journal= {arXiv preprint arXiv:2010.03284},
year = {2020}
}
备注
Accepted to the 21st International Society for Music Information Retrieval Conference (ISMIR 2020)