中文

FlowVocoder:一种基于归一化流的小 footprint 神经声码器用于语音合成

声音 2022-03-28 v2 机器学习 音频与语音处理

摘要

近来,自回归神经声码器在生成高保真语音方面表现出卓越性能,并能够实时合成语音。然而,诸如WaveFlow之类的自回归神经声码器虽能从梅尔频谱建模波形信号,其参数量却较大,难以部署在边缘设备上。尽管参数量小的NanoFlow是一种最先进的自回归神经声码器,但其性能略低于WaveFlow。因此,我们提出了一种称为FlowVocoder的新型自回归神经声码器,其内存占用小且能够实时生成高保真音频。我们提出的模型通过利用累积分布函数(CDF)的混合进行二分变换,改进了流块的密度估计。因此,该模型能够对波形信号建模,同时其内存占用远小于WaveFlow。如实验所示,FlowVocoder在主观和客观评测方面均与基线方法取得有竞争力的结果,并且更适用于实时文本到语音应用。

关键词

引用

@article{arxiv.2109.13675,
  title  = {FlowVocoder: A small Footprint Neural Vocoder based Normalizing flow for Speech Synthesis},
  author = {Manh Luong and Viet Anh Tran},
  journal= {arXiv preprint arXiv:2109.13675},
  year   = {2022}
}