基于音色描述符正则化变分自编码器的可解释音色合成
声音
2023-07-21 v1 音频与语音处理
摘要
可控音色合成数十年来一直是研究课题,深度神经网络在此领域最为成功。变分自编码器(VAE)等深度生成模型能够生成音频的高层表示并提供结构化潜空间。尽管有其优势,这些潜空间在人机感知层面的可解释性常受限。为克服此局限并增强对音色生成的控制,我们提出一种融合音色描述符的正则化 VAE 潜空间。此外,我们利用声音的谐波内容给出更简洁的声学表示,以最小化潜空间维度。
引用
@article{arxiv.2307.10283,
title = {Interpretable Timbre Synthesis using Variational Autoencoders Regularized on Timbre Descriptors},
author = {Anastasia Natsiou and Luca Longo and Sean O'Leary},
journal= {arXiv preprint arXiv:2307.10283},
year = {2023}
}