中文

STYLER:通过语音分解进行风格因子建模以实现快速鲁棒且富有表现力与可控的神经文本到语音合成

音频与语音处理 2021-06-28 v4 人工智能 计算与语言 声音

摘要

先前关于神经文本到语音(TTS)的研究在训练与推理时间的速度、困难合成条件下的鲁棒性、表现力以及可控性方面存在局限。尽管若干方法解决了部分限制,但尚未有尝试一次性解决所有弱点。本文中,我们提出 STYLER,一种具有高速且鲁棒合成的表现力与可控 TTS 框架。我们新颖的音频-文本对齐方法 Mel Calibrator 以及排除自回归解码实现了快速训练与推理以及对未见过数据的鲁棒合成。此外,有监督下的解耦风格因子建模增强了合成过程的可控性,从而实现表现力 TTS。在此基础上,一种利用域对抗训练与残差解码的新颖噪声建模流程赋能了噪声鲁棒的风格迁移,无需任何额外标签即可分解噪声。多种实验表明,STYLER 在速度与鲁棒性上优于带自回归解码的表现力 TTS,且在表现力与可控性上优于朗读风格非自回归 TTS。合成样本与实验结果通过我们的演示页面提供,代码已公开可用。

关键词

引用

@article{arxiv.2103.09474,
  title  = {STYLER: Style Factor Modeling with Rapidity and Robustness via Speech Decomposition for Expressive and Controllable Neural Text to Speech},
  author = {Keon Lee and Kyumin Park and Daeyoung Kim},
  journal= {arXiv preprint arXiv:2103.09474},
  year   = {2021}
}

备注

5 pages, 2 figures, Accepted to Interspeech 2021