中文

一种统御所有的深度音乐表示?:不同表示学习策略的比较分析

神经与进化计算 2019-02-13 v4 声音 音频与语音处理

摘要

受深度学习在计算机视觉与自然语言处理领域成功部署的启发,这一学习范式也进入了音乐信息检索领域。为了以有效且高效的方式受益于深度学习,深度迁移学习已成为一种常用方法。在该方法中,可复用预训练神经网络的输出作为新学习任务的基础。其潜在假设是:若初始学习任务与新学习任务具有共性且应用于同类输入数据(如音乐音频),则所生成的数据深度表示对新任务同样具有信息量。然而,由于大多数用于生成深度表示的网络仅使用单一初始学习源训练,其表示不大可能对所有未来可能的任务都具有信息量。本文展示了我们关于在音乐领域生成数据与学习任务深度表示的最重要因素的调研结果。我们通过一项涉及多学习源及具有不同源间信息共享程度的多种深度学习架构的广泛实证研究来进行此调研,以学习音乐表示。随后,我们考虑多个目标数据集对这些表示进行验证评估。实验结果就如何设计用于学习音乐领域可广泛部署的深度数据表示的方法提供了若干见解。

关键词

引用

@article{arxiv.1802.04051,
  title  = {One Deep Music Representation to Rule Them All? : A comparative analysis of different representation learning strategies},
  author = {Jaehun Kim and Julián Urbano and Cynthia C. S. Liem and Alan Hanjalic},
  journal= {arXiv preprint arXiv:1802.04051},
  year   = {2019}
}

备注

This work has been accepted to "Neural Computing and Applications: Special Issue on Deep Learning for Music and Audio"