中文

基于音色描述符正则化变分自编码器的可解释音色合成

声音 2023-07-21 v1 音频与语音处理

摘要

可控音色合成数十年来一直是研究课题,深度神经网络在此领域最为成功。变分自编码器(VAE)等深度生成模型能够生成音频的高层表示并提供结构化潜空间。尽管有其优势,这些潜空间在人机感知层面的可解释性常受限。为克服此局限并增强对音色生成的控制,我们提出一种融合音色描述符的正则化 VAE 潜空间。此外,我们利用声音的谐波内容给出更简洁的声学表示,以最小化潜空间维度。

关键词

引用

@article{arxiv.2307.10283,
  title  = {Interpretable Timbre Synthesis using Variational Autoencoders Regularized on Timbre Descriptors},
  author = {Anastasia Natsiou and Luca Longo and Sean O'Leary},
  journal= {arXiv preprint arXiv:2307.10283},
  year   = {2023}
}