WavThruVec:以隐层语音表征作为神经语音合成中间特征
声音
2022-11-22 v2 计算与语言
机器学习
音频与语音处理
摘要
近期神经文本到语音研究的进展主要由利用梅尔频谱图等低级中间语音表征的两阶段流水线主导。然而,此类预定特征存在根本局限,因为它们无法通过隐层表征学习来发挥数据驱动方法的全部潜力。为此,已有若干端到端方法被提出。但此类模型更难训练,且需要大量带转录的高质量录音。本文提出 WavThruVec——一种通过使用高维 Wav2Vec 2.0 嵌入作为中间语音表征来解决该瓶颈的两阶段架构。由于这些隐层激活提供高级语言学特征,其对噪声更具鲁棒性。这使得我们能够利用质量较低的标注语音数据集来训练第一阶段模块。同时,由于 Wav2Vec 2.0 嵌入已时间对齐,第二阶段组件可在大规模无转录音频语料上训练。这带来了对词汇表外词更强的泛化能力,以及对未见说话人更好的泛化。我们表明,所提模型不仅匹配最先进神经模型的质量,还呈现出支持语音转换或零样本合成等任务的有用特性。
引用
@article{arxiv.2203.16930,
title = {WavThruVec: Latent speech representation as intermediate features for neural speech synthesis},
author = {Hubert Siuzdak and Piotr Dura and Pol van Rijn and Nori Jacoby},
journal= {arXiv preprint arXiv:2203.16930},
year = {2022}
}
备注
Accepted to INTERSPEECH 2022. Audio samples are available at: https://charactr-platform.github.io/WavThruVec/