中文

交错语音-文本语言模型用于简单流式文本转语音合成

音频与语音处理 2025-08-12 v3

摘要

本文提出了交错语音-文本语言模型(Interleaved Speech-Text Language Model, IST-LM)用于零样例流式文本转语音(TTS)。不同于许多先前方法,IST-LM 直接在文本和语音标记以固定比例交错排列的序列上进行训练,无需额外的强制对齐或复杂的设计。文本块大小与语音块大小的比例对于 IST-LM 的性能至关重要。为探索这一问题,我们进行了对训练数据的全面统计分析,并对最终性能进行相关性分析,揭示了若干关键因素:1)语音标记与其对应文本标记之间的距离,2)每个语音标记可访问的未来文本标记的数量,3)语音标记紧随其对应文本标记出现的频率。实验结果展示了如何以有限的性能差距实现最优的流式 TTS 系统。IST-LM 概念简单且实践有效,使流式 TTS 能够在最小的开销下保持大部分性能,并为与大型语言模型实时文本流的集成提供了广泛的潜力。

关键词

引用

@article{arxiv.2412.16102,
  title  = {Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis},
  author = {Yifan Yang and Shujie Liu and Jinyu Li and Hui Wang and Lingwei Meng and Haiyang Sun and Yuzhe Liang and Ziyang Ma and Yuxuan Hu and Rui Zhao and Jianwei Yu and Yan Lu and Xie Chen},
  journal= {arXiv preprint arXiv:2412.16102},
  year   = {2025}
}