基于特征插值的语速可控 HiFi-GAN
声音
2022-04-25 v1 音频与语音处理
摘要
本文提出一种语速可控的 HiFi-GAN 神经声码器。原始 HiFi-GAN 是一种高保真、计算高效且占用空间小的神经声码器。我们试图将语速控制功能引入 HiFi-GAN,以提升合成语音的可及性。所提方法在 HiFi-GAN 架构中插入一个可微分的插值层。该方法实现了信号重采样方法和图像缩放方法,以扭曲神经声码器的梅尔频谱图或隐藏特征。我们还设计并开源了一个包含三种语速的日语语音语料库,用于评估所提语速控制方法。全面的客观与主观评价实验结果表明:1)所提方法在语音自然度上优于基线时间尺度修改算法;2)通过图像缩放扭曲梅尔频谱图在所有提出的方法中性能最佳;3)所提语速控制方法可集成到 HiFi-GAN 中而不损失计算效率。
引用
@article{arxiv.2204.10561,
title = {Speaking-Rate-Controllable HiFi-GAN Using Feature Interpolation},
author = {Detai Xin and Shinnosuke Takamichi and Takuma Okamoto and Hisashi Kawai and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2204.10561},
year = {2022}
}
备注
submitted to INTERSPEECH 2022