自监督语音表征在朗读与自发语音合成中的比较研究
音频与语音处理
2023-07-11 v2 人机交互
机器学习
声音
摘要
近期研究探索了在标准两阶段 TTS 中使用自监督学习(SSL)语音表征(如 wav2vec2.0)替代常规使用的 mel 谱图作为表征媒介。然而,尚不清楚哪种语音 SSL 更适合 TTS,以及朗读与自发 TTS(后者 arguably 更具挑战性)之间的性能是否存在差异。本研究旨在通过在不同朗读与自发语料的两阶段 TTS 中测试若干语音 SSL(包括同一 SSL 的不同层),同时保持 TTS 模型架构与训练设置不变,来解决这些问题。听测结果表明,12 层 wav2vec2.0(ASR 微调)的第 9 层在朗读与自发 TTS 中均优于其他被测 SSL 与 mel 谱图。我们的工作阐明了语音 SSL 如何能够轻易改进当前 TTS 系统,以及 SSL 在具挑战性的 TTS 生成任务中如何比较。音频示例见 https://www.speech.kth.se/tts-demos/ssr_tts
引用
@article{arxiv.2303.02719,
title = {A Comparative Study of Self-Supervised Speech Representations in Read and Spontaneous TTS},
author = {Siyang Wang and Gustav Eje Henter and Joakim Gustafson and Éva Székely},
journal= {arXiv preprint arXiv:2303.02719},
year = {2023}
}
备注
5 pages, 2 figures. ICASSP Workshop SASB (Self-Supervision in Audio, Speech and Beyond)2023