中文

FreeV: 通过伪逆 Mel 滤波器实现语音解码器的免费午餐

声音 2024-06-13 v1 音频与语音处理

摘要

语音解码器从声学特征重构语音波形,在现代语音合成系统中起着关键作用。频域 GAN 语音解码器如 Vocos 和 APNet2 最近取得了快速进展, 在推理速度上超过时域模型,同时实现了相当的音频质量。然而,这些频域解码器参数较大,导致额外的内存负担。灵感来自 PriorGrad 和 SpecGrad,我们采用伪逆来估计振幅谱作为初始化。这一简单的初始化显著减小了语音解码器的参数需求。基于 APNet2 和我们简化的振幅预测分支,我们提出我们的 FreeV。与其对应版本 APNet2 相比,FreeV 在推理速度上提高了 1.8 倍,参数几乎减半。同时,FreeV 在重合成质量方面超过 APNet2,为追求实时高保真语音合成迈出了一步。代码和模型权重可在 https://github.com/BakerBunker/FreeV 获取。

关键词

引用

@article{arxiv.2406.08196,
  title  = {FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter},
  author = {Yuanjun Lv and Hai Li and Ying Yan and Junhui Liu and Danming Xie and Lei Xie},
  journal= {arXiv preprint arXiv:2406.08196},
  year   = {2024}
}

备注

Accepted by InterSpeech 2024; 5 pages, 5 figures