中文

A$^3$T:用于语音合成与编辑的对齐感知声学-文本预训练

音频与语音处理 2022-06-22 v2 计算与语言 声音

摘要

近来,语音表征学习改进了许多语音相关任务,如语音识别、语音分类与语音到文本翻译。然而,上述任务均属语音理解方向,而对于逆向的语音合成,由于生成高质量语音的挑战性,表征学习的潜力尚待实现。为解决该问题,我们提出框架对齐感知声学-文本预训练(A3^3T),其在训练中以文本输入与声学-文本对齐重建被掩蔽的声学信号。如此,预训练模型可生成高质量重建谱图,可直接应用于语音编辑与未知说话人TTS。实验表明A3^3T在语音编辑上优于SOTA模型,并在无需外部说话人验证模型的情况下改进了多说话人语音合成。

关键词

引用

@article{arxiv.2203.09690,
  title  = {A$^3$T: Alignment-Aware Acoustic and Text Pretraining for Speech Synthesis and Editing},
  author = {He Bai and Renjie Zheng and Junkun Chen and Xintong Li and Mingbo Ma and Liang Huang},
  journal= {arXiv preprint arXiv:2203.09690},
  year   = {2022}
}

备注

Accepted by ICML 2022, 12 pages, 10 figures