面向可控复调音乐生成的可解释表示学习
声音
2020-08-18 v1 计算与语言
机器学习
音频与语音处理
摘要
尽管深度生成模型已成为算法作曲的主流方法,但由于大多数深度学习模型的潜变量缺乏良好的可解释性,控制生成过程仍是一个具有挑战性的问题。受内容-风格解耦思想启发,我们在 VAE 框架下设计了一种新颖架构,有效学习复调音乐的两个可解释潜因子:和弦与纹理。当前模型专注于学习 8 拍长的钢琴作曲片段。我们表明,这种和弦-纹理解耦提供了一条可控生成路径,带来广泛应用,包括作曲风格迁移、纹理变奏与伴奏编配。客观与主观评价均表明,我们的方法实现了成功的解耦与高质量的可控音乐生成。
引用
@article{arxiv.2008.07122,
title = {Learning Interpretable Representation for Controllable Polyphonic Music Generation},
author = {Ziyu Wang and Dingsu Wang and Yixiao Zhang and Gus Xia},
journal= {arXiv preprint arXiv:2008.07122},
year = {2020}
}