ToneUnit:面向声调语言语音合成的语音离散化方法
音频与语音处理
2024-09-04 v2 声音
摘要
将语音表示为离散单元在支持下游 spoken language 处理任务方面具有诸多好处。然而,该方法在类似普通话这样的声调语言语音合成中应用较少。我们的初步实验表明,中文语音合成存在“声调偏移”问题,即合成语音包含正确的基音节但不正确的声调。为解决此问题,我们提出 ToneUnit 框架,该框架利用带有声调标签的注释数据作为 CTC 监督项,用于学习中文语音的声调感知离散语音单元。我们的发现表明,通过 ToneUnit 获取的离散单元能够解决中文语音合成中的“声调偏移”问题,并在英语合成中取得良好结果。此外,实验结果表明,有限标量量化能够提高 ToneUnit 的效果。值得注意的是,ToneUnit 即使在最小的注释数据下也能有效工作。
引用
@article{arxiv.2406.08989,
title = {ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis},
author = {Dehua Tao and Daxin Tan and Yu Ting Yeung and Xiao Chen and Tan Lee},
journal= {arXiv preprint arXiv:2406.08989},
year = {2024}
}