中文

超越过平滑:评估DDPM和MSE在ASR可扩展语音合成中的表现

音频与语音处理 2024-10-17 v1 人工智能 计算与语言

摘要

合成语音已迅速接近人类的自然度水平。然而,矛盾的是,当ASR系统在人类认为自然的TTS输出上训练时,其性能仍然不佳。在这项工作中,我们探讨了这种现象是否是由于TTS中常用模型的过平滑行为所致,并特别关注随着TTS训练数据量的增加,TTS-for-ASR的行为。我们系统地比较了用于TTS的去噪扩散概率模型(DDPM)和基于均方误差(MSE)的模型在ASR模型训练中的表现。我们测试了这两种方法的可扩展性,同时改变了训练小时数和不同说话者的数量。我们发现,对于给定的模型大小,DDPM可以更好地利用更多的数据和更多样化的说话者,优于MSE模型。我们实现了迄今为止报告的最佳真实语音与合成语音词错误率之比(1.46),但也发现仍然存在很大的差距。

关键词

引用

@article{arxiv.2410.12279,
  title  = {Beyond Oversmoothing: Evaluating DDPM and MSE for Scalable Speech Synthesis in ASR},
  author = {Christoph Minixhofer and Ondrej Klejch and Peter Bell},
  journal= {arXiv preprint arXiv:2410.12279},
  year   = {2024}
}

备注

Under review at ICASSP 2025