中文

BridgeCode:面向自回归零样文本到语音合成的双语音表示范式

声音 2025-10-14 v1

摘要

自回归(AR)框架最近在零样文本到语音(TTS)中取得了显著进展,利用离散语音标记和大语言模型技术。尽管取得了成功,现有的 AR-based 零样 TTS 系统仍面临两个关键局限性:(i)固有的速度-质量权衡,因为顺序标记生成要么以牺牲表达性为代价降低帧率,要么以牺牲效率为代价丰富标记;(ii)面向文本的监督不匹配,因为交叉熵损失在不考虑相邻标记细粒度声学相似性的情况下对标记错误进行均匀惩罚。为解决这些挑战,我们提出了 BridgeTTS,一个基于 BridgeCode 双语音表示范式构建的新型 AR-TTS 框架。BridgeTTS 通过预测稀疏标记来减少 AR 迭代,同时重建丰富的连续特征以实现高质量合成。联合优化标记级和特征级目标进一步增强了自然度和可理解性。实验表明,BridgeTTS 在竞争性质量和说话人相似性方面显著加速了合成速度。

关键词

引用

@article{arxiv.2510.11646,
  title  = {BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis},
  author = {Jingyuan Xing and Mingru Yang and Zhipeng Li and Xiaofen Xing and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2510.11646},
  year   = {2025}
}