中文

利用高斯混合变分自编码器学习乐器音色与音高的解耦表示

机器学习 2019-07-02 v2 声音 音频与语音处理 机器学习

摘要

本文学习乐器声音中音色与音高的解耦表示。我们采用基于具有高斯混合潜变量分布的变分自编码器的框架。具体而言,我们使用两个独立的编码器分别学习音色和音高的不同潜空间,它们构成分别表示乐器身份和音高的高斯混合分量。对于重构,音色和音高的潜变量从相应的混合分量中采样,并拼接作为解码器的输入。我们通过潜空间可视化展示了模型的有效性,且定量分析表明这些空间具有可判别性,即使在训练所用乐器标签数量有限的情况下也是如此。该模型允许通过从潜空间采样对选定乐器声音进行可控合成。为评估这一点,我们使用原始标注数据训练了乐器和音高分类器。这些分类器在我们合成的声音上测试时达到了高准确率,从而验证了模型在可控逼真音色与音高合成上的性能。我们的模型还支持使用单一自编码器架构在多种乐器之间进行音色迁移,这通过测量乐器分类后验的变化来评估。我们的深入评估证实了模型成功解耦音色与音高的能力。

关键词

引用

@article{arxiv.1906.08152,
  title  = {Learning Disentangled Representations of Timbre and Pitch for Musical Instrument Sounds Using Gaussian Mixture Variational Autoencoders},
  author = {Yin-Jyun Luo and Kat Agres and Dorien Herremans},
  journal= {arXiv preprint arXiv:1906.08152},
  year   = {2019}
}

备注

20th Conference of the International Society for Music Information Retrieval