Dict-TTS:利用先验字典知识学习发音的文本到语音模型
音频与语音处理
2023-10-20 v3 计算与语言
声音
摘要
多音字消歧旨在从自然文本序列中获取准确的发音知识,以构建可靠的文本到语音(TTS)系统。然而,以往方法需要大量标注训练数据和语言专家额外投入,难以将高质量神经TTS系统扩展到域外日常对话和全球无数语言。本文从简洁新颖的视角解决多音字消歧问题:提出Dict-TTS,一种具有在线网站字典(自然语言中的现有先验信息)的语义感知生成式文本到语音模型。具体而言,我们设计语义到发音注意力(S2PA)模块,匹配输入文本序列与字典中先验语义之间的语义模式,并获取相应发音;S2PA模块可与端到端TTS模型轻松训练,无需任何标注音素标签。三种语言的实验结果表明,我们的模型在发音准确率上优于若干强基线模型,并改善了TTS系统的韵律建模。进一步的广泛分析表明Dict-TTS中的每项设计均有效。代码见 \url{https://github.com/Zain-Jiang/Dict-TTS}。
引用
@article{arxiv.2206.02147,
title = {Dict-TTS: Learning to Pronounce with Prior Dictionary Knowledge for Text-to-Speech},
author = {Ziyue Jiang and Zhe Su and Zhou Zhao and Qian Yang and Yi Ren and Jinglin Liu and Zhenhui Ye},
journal= {arXiv preprint arXiv:2206.02147},
year = {2023}
}
备注
v3: fix the introduction for the concurrent similar work of Neural Lexicon Reader (arXiv:2110.09698)