中文

自监督语音表征在自发语音合成中的应用

音频与语音处理 2023-07-12 v1 人机交互 机器学习 声音

摘要

从无转录的大量多样、混合质量语音数据中学到的自监督学习(SSL)语音表征,正在众多语音技术应用中占据一席之地。先前工作表明,SSL 是两段式文本到语音(TTS)中用于朗读和自发语音的有效中间表征。然而,哪种 SSL 以及每种 SSL 模型的哪一层最适合自发 TTS 仍不清楚。我们通过将自发 TTS 中 SSL 的比较范围扩展到 6 种不同 SSL 及每种 SSL 内 3 层,来解决这一不足。此外,SSL 在预测合成语音的平均意见得分(MOS)上也展现出潜力,但这仅用于朗读语音 MOS 预测。我们扩展了先前为朗读语音合成评分开发的基于 SSL 的 MOS 预测框架,并评估其在合成自发语音上的性能。所有实验在两个不同自发语料库上各进行两次,以寻找可泛化趋势。总体而言,我们给出了关于 SSL 在自发 TTS 和 MOS 预测中使用的全面实验结果,以进一步量化并理解 SSL 如何用于自发 TTS。音频样本:https://www.speech.kth.se/tts-demos/sp_ssl_tts

关键词

引用

@article{arxiv.2307.05132,
  title  = {On the Use of Self-Supervised Speech Representations in Spontaneous Speech Synthesis},
  author = {Siyang Wang and Gustav Eje Henter and Joakim Gustafson and Éva Székely},
  journal= {arXiv preprint arXiv:2307.05132},
  year   = {2023}
}

备注

7 pages, 2 figures. 12th ISCA Speech Synthesis Workshop (SSW) 2023