中文

平行GPT:调和声学与语义信息独立性与相互性的零样文本到语音

音频与语音处理 2025-08-29 v2 声音

摘要

语音表示和大型语言模型的进展显著提升了零样文本到语音(TTS)性能。然而,现有的零样TTS模型在捕捉声学和语义特征之间的复杂关联方面存在挑战,导致表现力不足和相似度低。其根本原因在于语义和声学特征之间的复杂关系,这种关系表现为独立和相互依赖的两个方面。本文提出了一种TTS框架,结合自回归(AR)和非自回归(NAR)模块,以调和声学和语义信息的独立性与相互性。AR模型利用提出的平行标记化器同时合成顶级语义和声学标记。相反,考虑到相互依赖性,耦合NAR模型基于通用AR模型的输出预测详细标记。基于此架构构建的平行GPT旨isincrease通过其平行结构改进零样文本到语音合成。在英语和中文数据集上的实验表明,所提方法显著优于现有零样TTS模型的质量和效率。语音演示可在 https://t1235-ch.github.io/pgpt/ 查看。

关键词

引用

@article{arxiv.2508.04141,
  title  = {Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech},
  author = {Jingyuan Xing and Zhipeng Li and Jialong Mai and Xiaofen Xing and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2508.04141},
  year   = {2025}
}

备注

Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)