中文

FlexSpeech:面向稳定、可控与表达的文本转语音

音频与语音处理 2025-05-16 v3

摘要

当前的语音生成研究可分为两类:非自回归和自回归。两者的根本区别在于用于可预测序列的时长预测策略。非自回归方法通过显式且独立地建模每个音素单元的时长,确保语音生成的稳定性。而自回归方法则采用自回归范式,隐式地通过马尔可夫性质预测压缩后的语音标记,从而提升韵律,但缺乏保证稳定性的结构。为同时解决语音生成中稳定性和自然性的问题,我们提出FlexSpeech——一个稳定、可控且富有表现力的TTS模型。FlexSpeech的动机是将马尔可夫依赖性和偏好优化直接引入时长预测器,以提升其自然性,同时保持对音素单元的显式建模以确保稳定性。具体而言,我们将语音生成任务分解为两个组件:一个自回归时长预测器和一个非自回归声学模型。该声学模型在大量数据上进行训练,学习如何给定参考语音韵律和音素时长,以更稳定地渲染音频。时长预测器在轻量级方式下针对不同的风格变体进行优化,从而实现快速的风格迁移,同时保持与指定说话人声纹的解耦关系。实验结果表明,我们的方法在零样本TTS中实现了SOTA水平的稳定性和自然性。更重要的是,在迁移到特定风格领域时,仅需约100个数据样本即可轻量级优化时长模块,而无需调整声学模型,从而实现快速且稳定的风格迁移。

关键词

引用

@article{arxiv.2505.05159,
  title  = {FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech},
  author = {Linhan Ma and Dake Guo and He Wang and Jin Xu and Lei Xie},
  journal= {arXiv preprint arXiv:2505.05159},
  year   = {2025}
}

备注

10 pages, 5 figures