自回归语音生成的并行合成
声音
2024-06-06 v3 音频与语音处理
摘要
自回归神经声码器在文本转语音和语音转换等语音合成任务中取得了卓越性能。自回归声码器基于先前时间步的样本预测某一时间步的样本。尽管其合成出自然的人声,但迭代生成不可避免地使合成时间与语音时长成正比,导致效率低下。许多工作致力于并行生成整个语音序列,并提出了基于 GAN、基于流和基于得分的声码器。本文为自回归生成提出了一种新思路。所提模型不沿时间序列迭代预测样本,而是执行频率维自回归生成(FAR)与比特维自回归生成(BAR)来合成语音。在 FAR 中,一条语音被划分为多个频率子带,且一个子带的生成以先前生成的子带为条件。类似地,在 BAR 中,一个 8 位量化信号从第一位开始迭代生成。通过重新设计自回归方法以在时域之外的域中计算,所提模型的迭代次数不再与语音时长成正比,而是与子带/比特数成正比,显著提升了推理效率。此外,采用后滤波器从输出后验中采样信号;其训练目标基于所提方法的特点设计。实验结果表明,所提模型无需 GPU 加速即可比实时更快地合成语音。与基线声码器相比,所提模型取得了更好的 MUSHRA 结果,并对未见说话人与 44 kHz 语音表现出良好的泛化能力。
引用
@article{arxiv.2204.11806,
title = {Parallel Synthesis for Autoregressive Speech Generation},
author = {Po-chun Hsu and Da-rong Liu and Andy T. Liu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2204.11806},
year = {2024}
}
备注
IEEE/ACM Transactions on Audio, Speech, and Language Processing