中文

FastFit:以多重短时傅里叶变换替代 U-Net 编码器实现实时迭代神经声码器

音频与语音处理 2023-05-19 v1 机器学习 声音

摘要

本文提出 FastFit,一种新颖的神经声码器架构,其以多重短时傅里叶变换(STFT)替代 U-Net 编码器,在不牺牲采样质量的前提下实现更快的生成速率。我们将每个编码器模块替换为参数等于各解码器模块时间分辨率的 STFT,从而形成跳跃连接。FastFit 在保持高保真度的同时,将模型参数量和生成时间减少近一半。通过客观与主观评测,我们证明所提模型达到约两倍于基于迭代的基线声码器的生成速度,同时保持高音质。我们进一步表明,在包括多说话人与零样本文本到语音在内的文本到语音评测场景中,FastFit 产生的音质与其他基线相近。

关键词

引用

@article{arxiv.2305.10823,
  title  = {FastFit: Towards Real-Time Iterative Neural Vocoder by Replacing U-Net Encoder With Multiple STFTs},
  author = {Won Jang and Dan Lim and Heayoung Park},
  journal= {arXiv preprint arXiv:2305.10823},
  year   = {2023}
}

备注

Accepted to INTERSPEECH 2023