中文

探究普通话 TTS 模型中声调的语音与音系知识

计算与语言 2019-12-24 v1 声音 音频与语音处理

摘要

本研究通过两个实验探究 TTS 模型对词汇声调的语音与音系知识。将用于测试普通话声调协同发音与变调的受控刺激输入 Tacotron 2 和 WaveGlow 以生成语音样本,并对其进行声学分析与人工评测。结果表明,基线 Tacotron 2 与带 BERT 嵌入的 Tacotron 2 均能较好地捕捉表层声调协同发音模式,但未能将第三声变调规则一致地应用于新句子。将预训练 BERT 嵌入融入 Tacotron 2 可提升自然度与韵律表现,并使第三声变调规则对新复合句具有更好的泛化能力,尽管第三声变调的整体准确率仍较低。鉴于 TTS 模型确实能捕捉某些语言现象,本文认为其可用于生成并验证特定的语言学假设。另一方面,也建议在 TTS 模型的训练与评测中纳入具有语言学信息的刺激。

关键词

引用

@article{arxiv.1912.10915,
  title  = {Probing the phonetic and phonological knowledge of tones in Mandarin TTS models},
  author = {Jian Zhu},
  journal= {arXiv preprint arXiv:1912.10915},
  year   = {2019}
}

备注

Submitted to Speech Prosody 2020