中文

论合成训练数据的音素时长可变性对自动语音识别的相关性

计算与语言 2023-10-13 v1 声音 音频与语音处理

摘要

由文本到语音(TTS)系统生成的合成数据可用于改进低资源或领域失配任务中的自动语音识别(ASR)系统。已有研究表明,TTS 生成的输出仍不具备与真实数据相同的特性。在这项工作中,我们关注合成数据的时间结构及其与 ASR 训练的关系。通过使用一种新颖的 oracle 设置,我们展示了在非自回归(NAR)TTS 中,时长建模对合成数据质量退化的影响程度。为获取参考音素时长,我们使用了两种常见的对齐方法:隐马尔可夫高斯混合模型(HMM-GMM)对齐器和神经连接时序分类(CTC)对齐器。基于随机游走的一种简单算法,我们将 TTS 系统的音素时长分布向真实时长偏移,从而在半监督设定下使用合成数据的 ASR 系统取得了改进。

关键词

引用

@article{arxiv.2310.08132,
  title  = {On the Relevance of Phoneme Duration Variability of Synthesized Training Data for Automatic Speech Recognition},
  author = {Nick Rossenbach and Benedikt Hilmes and Ralf Schlüter},
  journal= {arXiv preprint arXiv:2310.08132},
  year   = {2023}
}

备注

To appear at ASRU 2023