音乐信息检索中的深度分层学习
声音
2018-12-11 v3 音频与语音处理
摘要
近年来,深度学习提升了许多音乐信息检索(MIR)系统的性能。然而,音乐复杂的层次化编排使得端到端学习对某些MIR任务而言十分困难——需要非常深且灵活的处理链来建模音乐的某些方面。涉及音、和弦与节奏的表示是音乐的基本构建块。本文讨论如何将这些作为MIR中的中间目标与先验,以处理结构复杂的学习问题,其中学习模块连接于有向无环图中。我们认为这种被称为深度分层学习(DLL)的推断策略可通过(1)在处理过程中强制中间表示的有效性与不变性,以及(2)让推断出的表示确立音乐组织以支持更高层次的不变性处理,从而帮助泛化。文中提供了模块化音乐处理的背景及以往文献综述。在DLL语境下回顾了信息处理的相关概念,如剪枝、跳跃连接与性能监督。最后进行了一项测试,展示分层学习如何影响音高跟踪。结果表明,若以提取的逐帧基频为指导,特别是断音更容易检测。
引用
@article{arxiv.1804.07297,
title = {Deep Layered Learning in MIR},
author = {Anders Elowsson},
journal= {arXiv preprint arXiv:1804.07297},
year = {2018}
}
备注
Submitted for publication. Feedback always welcome