SemanticVocoder:通过语义潜在向量桥接音频生成与音频理解
声音
2026-02-27 v1
摘要
最近的音频生成模型通常依赖于变分自编码器(VAEs),在VAE潜在空间中进行生成。虽然VAEs在压缩和重构方面表现出色,但其潜在变量本质上编码了低层次声学细节,而非语义判别信息,这导致事件语义被耦合, complicating generative model的训练。为此,我们放弃VAE声学潜在变量,引入语义编码器潜在变量,从而提出SemanticVocoder,一个直接从语义潜在变量合成波形的生成式声码器。凭借SemanticVocoder,我们的文本到音频生成模型在AudioCaps测试集上实现了12.823的Fréchet Distance和1.709的Fréchet Audio Distance,因为引入的语义潜在变量在判别性上优于声学VAE潜在变量。除了改进的生成性能之外,它还作为一种通向统一语义空间内音频理解和生成的有前景的尝试。生成样本可在 https://zeyuxie29.github.io/SemanticVocoder/ 查看。
引用
@article{arxiv.2602.23333,
title = {SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents},
author = {Zeyu Xie and Chenxing Li and Qiao Jin and Xuenan Xu and Guanrou Yang and Wenfu Wang and Mengyue Wu and Dong Yu and Yuexian Zou},
journal= {arXiv preprint arXiv:2602.23333},
year = {2026}
}
备注
Demo: https://zeyuxie29.github.io/SemanticVocoder/