中文

通过目标-KL正则化驾驭音频VAE

声音 2026-05-19 v1 机器学习 音频与语音处理

摘要

潜在扩散模型已成为许多生成任务的主导范式,包括音频生成,如文本到音频、文本到音乐和文本到语音。潜在扩散的一个关键组件是自动编码器 (VAE),它将高维信号压缩到低帧率的连续表示,以利于下游预测。对这些VAE进行正则化具有挑战性,因为存在在过度正则化(导致输出质量差)和欠正则化(难以预测)之间的权衡。我们提出了通过压缩和通过目标-KL正则化在特定比特率下训练Audio VAE的框架。这允许直接与众所周知的离散神经音频编解码器进行比较,并构建比特率-失真曲线。我们评估了目标-KL正则化对文本到声音生成的影响,并发现扫描压缩率有助于识别最佳生成设置。

关键词

引用

@article{arxiv.2605.17085,
  title  = {Taming Audio VAEs via Target-KL Regularization},
  author = {Prem Seetharaman and Rithesh Kumar},
  journal= {arXiv preprint arXiv:2605.17085},
  year   = {2026}
}

备注

Accepted at ICASSP 2026 (Barcelona, Spain, 3-8 May 2026). 5 pages, 1 figure, 3 tables