中文

评估 Timbre VAEs 中潜在空间结构:无监督、描述条件和感知特征条件模型的比较研究

声音 2026-03-18 v1

摘要

我们对三种变分自编码器(VAEs)用于音乐音色生成的潜在空间组织进行比较评估:一种无监督 VAE、一种描述条件 VAE 和一种基于 AudioCommons 音色模型中连续感知特征条件的 VAE。使用一套标有 19 个语义描述符的电吉他声音数据集(跨四个强度等级),我们评估每个模型的潜在结构,包括轮廓得分、音色描述紧凑性、音高条件分离性、轨迹线性度和跨音高一致性。我们的发现表明,基于感知特征的条件化可获得更紧凑、更具辨识度且对音高不变的潜在空间,超越了无监督模型和离散描述符条件模型。这一工作突显了单热编码语义条件化的局限性,提供了评估音色潜在空间的方法论工具,推动了更可控、更可解释的生成音频模型的发展。

关键词

引用

@article{arxiv.2603.16713,
  title  = {Evaluating Latent Space Structure in Timbre VAEs: A Comparative Study of Unsupervised, Descriptor-Conditioned, and Perceptual Feature-Conditioned Models},
  author = {Joseph Cameron and Alan Blackwell},
  journal= {arXiv preprint arXiv:2603.16713},
  year   = {2026}
}

备注

5 pages, 1 figure, 1 table