中文

语义-VAE:用于更佳语音合成的语义对齐潜在表示

机器学习 2026-04-27 v4 人工智能

摘要

虽然mel频谱图在零样文本到语音(TTS)中被广泛用作中间表示,但其固有的冗余导致学习文本-语音对齐效率低下。紧凑的VAE基模型的潜在表示最近作为更有力的替代方案,但也面临根本优化困境:高维潜在空间改善重构质量和说话人相似度,却降低语音可理解性;而低维潜在空间则提升可理解性,却牺牲重构保真度。为克服这一困境,我们提出Semantic-VAE,一种 novel VAE框架,利用语义对齐正则化于潜在空间中。该设计通过捕获高维潜在表示中的语义结构,化解了重构-生成之间的权衡。大量实验表明,Semantic-VAE显著提升了合成质量和训练效率。当集成到F5-TTS中时,我们的方法在LibriSpeech-PC上实现2.10% WER和0.64说话人相似度,超越基于mel的系统(2.23%,0.60)和纯粹声学VAE基线(2.65%,0.59)。我们也发布了代码和模型以促进进一步研究。

关键词

引用

@article{arxiv.2509.22166,
  title  = {Motivating Next-Gen Accelerators with Flexible (N:M) Activation Sparsity via Benchmarking Lightweight Post-Training Sparsification Approaches},
  author = {Shirin Alanova and Kristina Kazistova and Ekaterina Galaeva and Alina Kostromina and Vladimir Smirnov and Redko Dmitry and Alexey Dontsov and Maxim Zhelnin and Evgeny Burnaev and Egor Shvetsov},
  journal= {arXiv preprint arXiv:2509.22166},
  year   = {2026}
}