中文

生成式音色空间:用感知度量正则化变分自编码器

声音 2018-10-02 v3 音频与语音处理

摘要

音色空间已在音乐感知中用于基于不相似度评分研究乐器间的感知关系。然而,这些空间无法泛化至新样本,且不提供可逆映射,阻碍了音频合成。与此同时,生成模型旨在提供合成新音色的方法。但这些系统无法提供对其内部机理的理解,且通常与任何感知相关信息无关。在此,我们展示变分自编码器(VAE)可通过构造生成式音色空间缓解上述所有局限。为此,我们调整VAE以学习音频潜空间,同时利用音色研究中的感知评分来正则化该空间的组织。所得空间允许我们分析新乐器,并能从该空间任意点合成音频。我们引入一种特定正则化,可将任意给定相似距离强加于这些空间。我们展示所得空间提供与音色空间几乎相似的距离关系。我们评估了若干谱变换,表明非平稳Gabor变换(NSGT)与音色空间相关性最高且合成质量最佳。此外,我们展示这些空间可泛化至新乐器,并能在乐器间生成任意路径以理解其音色关系。由于这些空间是连续的,我们研究音频描述符沿潜维度的行为。我们展示尽管描述符具有整体非线性拓扑,它们遵循局部平滑演化。基于此,我们提出一种基于描述符的合成方法,并展示可在保持乐器音色结构的同时控制其描述符。

关键词

引用

@article{arxiv.1805.08501,
  title  = {Generative timbre spaces: regularizing variational auto-encoders with perceptual metrics},
  author = {Philippe Esling and Axel Chemla--Romeu-Santos and Adrien Bitton},
  journal= {arXiv preprint arXiv:1805.08501},
  year   = {2018}
}

备注

Digital Audio Conference (DaFX 2018)