神经 HMM 足矣(用于高质量无注意力 TTS)
音频与语音处理
2022-05-03 v6 人机交互
机器学习
声音
摘要
神经序列到序列 TTS 已比使用 HMM 的统计语音合成取得了显著更好的输出质量。然而,神经 TTS 一般不是概率性的,且使用非单调注意力。注意力失败会增加训练时间,并可能使合成语音 incoherently 胡言乱语。本文描述了如何将旧与新范式结合以兼得两者优势,即用由神经网络定义的自回归从左到右无跳跃隐马尔可夫模型替换神经 TTS 中的注意力。基于此提议,我们修改 Tacotron 2 以获得基于 HMM 的单调对齐神经 TTS 模型,训练以最大化完整序列似然而无近似。我们也描述了如何结合经典与当代 TTS 的思想以获得最佳结果。所得示例系统比 Tacotron 2 更小更简单,以更少迭代和更少数据学会说话,同时在 post-net 之前达到可比的自然度。我们的方法也允许对语速的简便控制。
引用
@article{arxiv.2108.13320,
title = {Neural HMMs are all you need (for high-quality attention-free TTS)},
author = {Shivam Mehta and Éva Székely and Jonas Beskow and Gustav Eje Henter},
journal= {arXiv preprint arXiv:2108.13320},
year = {2022}
}
备注
5 pages, 2 figures; final version for ICASSP 2022