解耦就足够了吗?关于可控音乐生成的潜在表示
声音
2021-08-04 v1 机器学习
音频与语音处理
摘要
在音乐深度生成模型的背景下,提高可控性或操控生成数据一个或多个属性的能力已成为一个备受关注的课题。近期在这方面的尝试依赖于从数据中学习解耦表示,使得潜在的变化因素被很好地分离。在本文中,我们通过使用基于变分自编码器(VAE)架构的不同监督解耦学习算法进行系统研究,重点关注解耦与可控性之间的关系。我们的实验表明,通过使用不同形式的监督来训练一个强大的判别式编码器,可以实现高度的解耦。然而,在缺乏强大生成式解码器的情况下,解耦并不必然意味着可控性。潜在空间相对于 VAE 解码器的结构在提升生成模型操控不同属性的能力方面起着重要作用。为此,我们还提出了方法和度量标准,以帮助评估潜在空间在所提供的可控性程度方面的质量。
引用
@article{arxiv.2108.01450,
title = {Is Disentanglement enough? On Latent Representations for Controllable Music Generation},
author = {Ashis Pati and Alexander Lerch},
journal= {arXiv preprint arXiv:2108.01450},
year = {2021}
}
备注
To be published in: Proceedings of 22nd International Society for Music Information Retrieval Conference (ISMIR), Online, 2021