Music SketchNet:基于音高与节奏分解表示的可控音乐生成
机器学习
2021-03-31 v1 多媒体
声音
音频与语音处理
机器学习
摘要
类比自动图像补全系统,我们提出Music SketchNet,一种允许用户指定部分音乐想法以引导自动音乐生成的神经网络框架。我们专注于生成不完整单声部音乐片段中缺失的小节,以周围上下文为条件,并可选择性地由用户指定的音高和节奏片段引导。首先,我们引入SketchVAE,一种新颖的变分自编码器,显式分解节奏与音高轮廓,构成我们所提模型的基础。随后我们引入两种判别架构SketchInpainter和SketchConnector,二者协同完成引导式音乐补全,以周围上下文和用户指定片段为条件填充缺失小节的表示。我们在标准爱尔兰民乐数据集上评估SketchNet,并与近期工作中的模型比较。当用于音乐补全时,我们的方法在客观指标和主观听感测试上均优于SOTA。最后,我们展示模型能在生成过程中成功融入用户指定片段。
引用
@article{arxiv.2008.01291,
title = {Music SketchNet: Controllable Music Generation via Factorized Representations of Pitch and Rhythm},
author = {Ke Chen and Cheng-i Wang and Taylor Berg-Kirkpatrick and Shlomo Dubnov},
journal= {arXiv preprint arXiv:2008.01291},
year = {2021}
}
备注
8 pages, 8 figures, Proceedings of the 21st International Society for Music Information Retrieval Conference, ISMIR 2020