中文

基于可逆神经网络的可解释复调音乐转写

声音 2019-09-05 v1 音频与语音处理

摘要

我们探索了一种将复调音乐转写任务概念化的新方式,使用所谓的可逆神经网络。可逆模型以单一函数统一判别与生成两方面,并共享同一组参数。引入可逆性使实践者能直接检视判别模型所学到的内容,并精确判定哪些输入导致哪些输出。对于将复调音频转写为符号形式的任务,这些模型可能尤为有用,因为它们让我们能够观察,例如仅从复调音乐语料中可在多大程度上学到单音这一概念(近期研究已指出这是一个严重问题)。这是一种全新的音频转写思路,首先需做一些基础工作。本文中,我们从最简单的可逆转写模型入手,随后彻底研究其性质。最后,我们迈向更精密、更强能力版本的初步步骤。我们以钢琴转写任务、特别是 MAPS 数据集作为这些研究的基础。

关键词

引用

@article{arxiv.1909.01622,
  title  = {Towards Interpretable Polyphonic Transcription with Invertible Neural Networks},
  author = {Rainer Kelz and Gerhard Widmer},
  journal= {arXiv preprint arXiv:1909.01622},
  year   = {2019}
}

备注

Published at the 20th International Society for Music Information Retrieval Conference, Delft, The Netherlands, 2019