中文

音色潜在空间:探索与创作维度

声音 2020-08-18 v2 机器学习 音频与语音处理

摘要

近期研究表明,无监督模型能够利用自编码器学习可逆的音频表示。这些方法可实现高质量声音合成,但由于潜在空间未能解耦音色属性,其可控性有限。变分自编码器(VAEs)中解耦表示的涌现已被研究并应用于音频。采用额外的感知正则化可使此类潜在表示与此前建立的多维音色空间对齐,同时支持连续推断与合成。或者,可将某些特定声音属性作为控制变量学习,而无监督维度负责其余特征。生成式神经网络为音色操控带来了新的可能,但对其表示的探索与创造性使用仍十分匮乏。以下实验与两位作曲家合作开展,借助专门设计的接口(Max/MSP、Pure Data)或基于描述符合成的参数映射,提出了探索音乐音色潜在声音合成的新创作方向。

关键词

引用

@article{arxiv.2008.01370,
  title  = {Timbre latent space: exploration and creative aspects},
  author = {Antoine Caillon and Adrien Bitton and Brice Gatinet and Philippe Esling},
  journal= {arXiv preprint arXiv:2008.01370},
  year   = {2020}
}