MoBoAligner:一种基于单调边界搜索的非自回归 TTS 神经对齐模型
音频与语音处理
2020-06-11 v2 声音
摘要
为加速神经语音合成的推理,非自回归模型近来受到越来越多的关注。在非自回归模型中,需要文本 token 的额外时长以在编码器与解码器间建立硬对齐。基于时长的对齐起着关键作用,因为它控制文本 token 与频谱帧之间的对应关系,并决定合成音频的节奏与速度。为获得更好的基于时长的对齐并提升非自回归语音合成质量,本文提出一种名为 MoBoAligner 的新型神经对齐模型。给定文本与梅尔谱的配对,MoboAligner 尝试基于神经语义空间中的 token-帧相似度,以端到端框架在给定梅尔频谱帧中识别文本 token 的边界。利用这些边界可提取时长,并用于非自回归 TTS 模型的训练。与 TransformerTTS 提取的时长相比,MoboAligner 为非自回归 TTS 模型带来 MOS 上的提升(3.74 对比 FastSpeech 的 3.44)。此外,MoboAligner 为任务专用且轻量,参数量减少 45%,训练耗时减少 30%。
引用
@article{arxiv.2005.08528,
title = {MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search},
author = {Naihan Li and Shujie Liu and Yanqing Liu and Sheng Zhao and Ming Liu and Ming Zhou},
journal= {arXiv preprint arXiv:2005.08528},
year = {2020}
}