面向人机音乐协同创作的平坦潜在流形
声音
2022-08-11 v3 机器学习
音频与语音处理
摘要
在艺术音乐生成中使用机器学习引发了关于艺术质量的争议性讨论,对此客观量化毫无意义。因此,我们将音乐生成算法视为人类音乐家的对应方,在一种相互作用旨在为音乐家与观众带来新体验的设置中。为获得此行为,我们借助循环变分自编码器(VAE)框架,学习以人类音乐家为种子生成音乐。在所学模型中,我们通过潜在空间中的插值生成新颖的音乐序列。然而标准 VAE 并不保证其潜在表示具有任何形式的平滑性。这转化为生成音乐序列中的突变。为克服这些局限,我们对解码器进行正则化,并赋予潜在空间一个平坦黎曼流形,即与欧氏空间等距的流形。结果,在潜在空间中的线性插值产生了逼真且平滑的音乐变化,契合我们所追求的机器—音乐家交互类型。我们通过音乐数据集上的一组实验为我们的方法提供了经验证据,并将我们的模型部署用于与一位专业鼓手的互动即兴演奏。现场表演提供了定性证据,表明潜在表示可被鼓手直观解读并利用以驱动交互。除音乐应用外,我们的方法展示了一个以人为中心的机器学习模型设计实例,由可解释性与终端用户交互所驱动。
引用
@article{arxiv.2202.12243,
title = {Flat Latent Manifolds for Human-machine Co-creation of Music},
author = {Nutan Chen and Djalel Benbouzid and Francesco Ferroni and Mathis Nitschke and Luciano Pinna and Patrick van der Smagt},
journal= {arXiv preprint arXiv:2202.12243},
year = {2022}
}
备注
3rd Conference on AI Music Creativity (AIMC 2022)