面向并行化 TTS 前端建模的先验无关多尺度对比文本-音频预训练
声音
2024-04-16 v1 人工智能
音频与语音处理
摘要
在过去的十年中,一系列不懈的努力致力于开发高度富有表现力和可控的文本到语音(TTS)系统。通常,整体的 TTS 包含两个相互连接的组件:前端模块和后端模块。前端擅长从原始文本输入中捕获语言表征,而后端模块则将语言线索转换为语音。研究界对前端组件的研究兴趣日益增长,认识到其在文本到语音系统中的关键作用,包括文本规范化(TN)、韵律边界预测(PBP)和多音字消歧(PD)。尽管如此,标注文本数据不足的限制以及对同质文本信号的依赖,严重削弱了其监督学习的有效性。为了规避这一障碍,本文提出了一种新颖的两阶段 TTS 前端预测流水线,名为 TAP-FM。具体来说,在第一个学习阶段,我们提出了一种多尺度对比文本-音频预训练协议(MC-TAP),该协议致力于通过无监督方式的多粒度对比预训练来获取更丰富的洞察。与先前预训练方法中挖掘同质特征不同,我们的框架展示了深入挖掘全局和局部文本-音频语义及声学表征的能力。此外,在第二阶段,我们精心设计了一个并行化的 TTS 前端模型,以分别执行 TN、PD 和 PBP 预测任务。最后,大量实验证明了我们提出的方法的优越性,达到了最先进的性能。
引用
@article{arxiv.2404.09192,
title = {Prior-agnostic Multi-scale Contrastive Text-Audio Pre-training for Parallelized TTS Frontend Modeling},
author = {Quanxiu Wang and Hui Huang and Mingjie Wang and Yong Dai and Jinzuomu Zhong and Benlai Tang},
journal= {arXiv preprint arXiv:2404.09192},
year = {2024}
}