中文

自监督语音表征在朗读与自发语音合成中的比较研究

音频与语音处理 2023-07-11 v2 人机交互 机器学习 声音

摘要

近期研究探索了在标准两阶段 TTS 中使用自监督学习(SSL)语音表征(如 wav2vec2.0)替代常规使用的 mel 谱图作为表征媒介。然而,尚不清楚哪种语音 SSL 更适合 TTS,以及朗读与自发 TTS(后者 arguably 更具挑战性)之间的性能是否存在差异。本研究旨在通过在不同朗读与自发语料的两阶段 TTS 中测试若干语音 SSL(包括同一 SSL 的不同层),同时保持 TTS 模型架构与训练设置不变,来解决这些问题。听测结果表明,12 层 wav2vec2.0(ASR 微调)的第 9 层在朗读与自发 TTS 中均优于其他被测 SSL 与 mel 谱图。我们的工作阐明了语音 SSL 如何能够轻易改进当前 TTS 系统,以及 SSL 在具挑战性的 TTS 生成任务中如何比较。音频示例见 https://www.speech.kth.se/tts-demos/ssr_tts

关键词

引用

@article{arxiv.2303.02719,
  title  = {A Comparative Study of Self-Supervised Speech Representations in Read and Spontaneous TTS},
  author = {Siyang Wang and Gustav Eje Henter and Joakim Gustafson and Éva Székely},
  journal= {arXiv preprint arXiv:2303.02719},
  year   = {2023}
}

备注

5 pages, 2 figures. ICASSP Workshop SASB (Self-Supervision in Audio, Speech and Beyond)2023