中文

利用非配对文本数据的 TTS 与 ASR 半监督联合训练中的说话人一致性损失与逐步优化

声音 2022-07-12 v1 音频与语音处理

摘要

在本文中,我们研究文本到语音(TTS)与自动语音识别(ASR)的半监督联合训练,其中可用少量配对数据和大量非配对文本数据。传统研究构建了一个称为 TTS-ASR 流水线的循环,其中多说话人 TTS 模型利用参考语音从文本合成语音,ASR 模型从合成语音重建文本,之后两个模型均使用循环一致性损失进行训练。然而,合成语音并未反映参考语音的说话人特征,且训练后合成语音对 ASR 模型而言变得过于容易识别。这不仅降低了 TTS 模型质量,也限制了 ASR 模型的提升。为解决该问题,我们提出通过说话人一致性损失和逐步优化来改进基于循环一致性的训练。说话人一致性损失使合成语音的说话人特征更接近参考语音。在逐步优化中,我们在两个模型训练前先冻结 TTS 模型的参数,以避免 TTS 模型对 ASR 模型的过度适应。实验结果证明了所提方法的有效性。

关键词

引用

@article{arxiv.2207.04659,
  title  = {Speaker consistency loss and step-wise optimization for semi-supervised joint training of TTS and ASR using unpaired text data},
  author = {Naoki Makishima and Satoshi Suzuki and Atsushi Ando and Ryo Masumura},
  journal= {arXiv preprint arXiv:2207.04659},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022