度量学习 vs 分类用于解耦音乐表征学习
声音
2020-08-14 v2 信息检索
机器学习
音频与语音处理
摘要
深度表征学习提供了一种强大的范式,用于将输入数据映射到有组织的嵌入空间中,并对许多音乐信息检索任务十分有用。表征学习的两种核心方法包括深度度量学习和分类,两者的目标相同,即学习一种能够跨任务良好泛化的表征。除泛化能力外,解耦表征这一新兴概念也备受关注,其中多个语义概念(如流派、情绪、乐器配置)被联合学习但在所学表征空间中保持可分离。本文提出一个统一的表征学习框架,以整体方式阐明度量学习、分类与解耦之间的关系。为此,我们(1)概述了关于度量学习与分类之间关系的已有工作,(2)通过将这一关系扩展到多标签数据,探索三种不同的学习方法及其解耦版本,(3)在四项任务(训练时间、相似度检索、自动标注和三重预测)上评估所有模型。我们发现基于分类的模型在训练时间、相似度检索和自动标注方面通常更具优势,而深度度量学习在三重预测上表现出更好的性能。最后,我们展示了所提方法在音乐自动标注上取得了最先进的(SOTA)结果。
引用
@article{arxiv.2008.03729,
title = {Metric Learning vs Classification for Disentangled Music Representation Learning},
author = {Jongpil Lee and Nicholas J. Bryan and Justin Salamon and Zeyu Jin and Juhan Nam},
journal= {arXiv preprint arXiv:2008.03729},
year = {2020}
}
备注
Accepted for publication at the 21st International Society for Music Information Retrieval Conference (ISMIR 2020)