在离散潜空间中学习音乐的分源感知表示
音频与语音处理
2021-11-29 v1 机器学习
声音
摘要
近年来,基于神经网络的方法被提出作为从音乐中生成表示的一种方法,但它们不可读,且难以被人分析或编辑。为解决此问题,我们提出一种通过矢量量化变分自编码器(VQ-VAE)学习音乐的分源感知潜表示的新方法。我们训练 VQ-VAE 将输入混合编码为离散潜空间中的整数张量,并设计其具有分解结构,使人能以分源感知的方式操纵潜向量。本文还表明,我们可以通过在离散空间中估计潜向量来生成低音线(basslines)。
引用
@article{arxiv.2111.13321,
title = {Learning source-aware representations of music in a discrete latent space},
author = {Jinsung Kim and Yeong-Seok Jeong and Woosung Choi and Jaehwa Chung and Soonyoung Jung},
journal= {arXiv preprint arXiv:2111.13321},
year = {2021}
}
备注
MDX Workshop @ ISMIR 2021, 7 pages, 2 figure