FastFit:以多重短时傅里叶变换替代 U-Net 编码器实现实时迭代神经声码器
音频与语音处理
2023-05-19 v1 机器学习
声音
摘要
本文提出 FastFit,一种新颖的神经声码器架构,其以多重短时傅里叶变换(STFT)替代 U-Net 编码器,在不牺牲采样质量的前提下实现更快的生成速率。我们将每个编码器模块替换为参数等于各解码器模块时间分辨率的 STFT,从而形成跳跃连接。FastFit 在保持高保真度的同时,将模型参数量和生成时间减少近一半。通过客观与主观评测,我们证明所提模型达到约两倍于基于迭代的基线声码器的生成速度,同时保持高音质。我们进一步表明,在包括多说话人与零样本文本到语音在内的文本到语音评测场景中,FastFit 产生的音质与其他基线相近。
引用
@article{arxiv.2305.10823,
title = {FastFit: Towards Real-Time Iterative Neural Vocoder by Replacing U-Net Encoder With Multiple STFTs},
author = {Won Jang and Dan Lim and Heayoung Park},
journal= {arXiv preprint arXiv:2305.10823},
year = {2023}
}
备注
Accepted to INTERSPEECH 2023