中文

面向文本到语音系统的总时长感知时长建模

音频与语音处理 2024-06-07 v1

摘要

通过调整语速来精确控制生成语音的总时长对于各种文本到语音(TTS)应用至关重要。然而,调整语速对语音质量(如可懂度和说话人特征)的影响尚未得到充分探索。在这项工作中,我们提出了一种新颖的TTS总时长感知(TDA)时长模型,其中音素时长不仅根据文本输入预测,还根据总目标时长的额外输入预测。我们还提出了一种基于MaskGIT的时长模型,增强了预测音素时长的多样性和质量。我们的结果表明,与基线模型相比,所提出的TDA时长模型在各种语速配置下实现了更好的可懂度和说话人相似度。我们还表明,所提出的基于MaskGIT的模型可以生成比其回归或流匹配对应模型更高质量和更多样性的音素时长。

关键词

引用

@article{arxiv.2406.04281,
  title  = {Total-Duration-Aware Duration Modeling for Text-to-Speech Systems},
  author = {Sefik Emre Eskimez and Xiaofei Wang and Manthan Thakker and Chung-Hsien Tsai and Canrun Li and Zhen Xiao and Hemin Yang and Zirun Zhu and Min Tang and Jinyu Li and Sheng Zhao and Naoyuki Kanda},
  journal= {arXiv preprint arXiv:2406.04281},
  year   = {2024}
}

备注

Accepted to Interspeech 2024