基于可逆神经网络的可解释复调音乐转写
声音
2019-09-05 v1 音频与语音处理
摘要
我们探索了一种将复调音乐转写任务概念化的新方式,使用所谓的可逆神经网络。可逆模型以单一函数统一判别与生成两方面,并共享同一组参数。引入可逆性使实践者能直接检视判别模型所学到的内容,并精确判定哪些输入导致哪些输出。对于将复调音频转写为符号形式的任务,这些模型可能尤为有用,因为它们让我们能够观察,例如仅从复调音乐语料中可在多大程度上学到单音这一概念(近期研究已指出这是一个严重问题)。这是一种全新的音频转写思路,首先需做一些基础工作。本文中,我们从最简单的可逆转写模型入手,随后彻底研究其性质。最后,我们迈向更精密、更强能力版本的初步步骤。我们以钢琴转写任务、特别是 MAPS 数据集作为这些研究的基础。
引用
@article{arxiv.1909.01622,
title = {Towards Interpretable Polyphonic Transcription with Invertible Neural Networks},
author = {Rainer Kelz and Gerhard Widmer},
journal= {arXiv preprint arXiv:1909.01622},
year = {2019}
}
备注
Published at the 20th International Society for Music Information Retrieval Conference, Delft, The Netherlands, 2019