增量式 FastPitch:基于分块的高质量文本到语音合成
声音
2024-01-04 v1 人工智能
音频与语音处理
摘要
并行文本到语音模型已被广泛应用于实时语音合成,与传统的自回归模型相比,它们提供了更强的可控性和更快的合成过程。尽管并行模型在许多方面具有优势,但由于其完全并行的架构(如 Transformer),它们天然不适合增量式合成。在这项工作中,我们提出了 Incremental FastPitch,这是一种新颖的 FastPitch 变体,通过采用基于分块的 FFT 模块改进架构、使用感受野受限的分块注意力掩码进行训练,以及利用固定大小的历史模型状态进行推理,能够增量式地生成高质量的梅尔频谱块。实验结果表明,我们的方案能够产生与并行 FastPitch 相当的语音质量,同时显著降低延迟,从而为实时语音应用提供更低的响应时间。
引用
@article{arxiv.2401.01755,
title = {Incremental FastPitch: Chunk-based High Quality Text to Speech},
author = {Muyang Du and Chuan Liu and Junjie Lai},
journal= {arXiv preprint arXiv:2401.01755},
year = {2024}
}
备注
5 pages, 4 figures, 1 table