中文

ZeSTA:基于域条件训练的零样文本语音合成数据增强

声音 2026-03-05 v1 人工智能 音频与语音处理

摘要

我们研究将零样文本语音合成(ZS-TTS)作为低资源个性化语音合成的数据增强来源。尽管合成语音提供了语言丰富且音素多样的语料,但 naively 将大量合成语音与有限的真实录音混合训练,常导致微调后说话人相似性下降。为此,我们提出ZeSTA—a 一种简单的数据域条件训练框架,通过轻量级域嵌入区分真实与合成语音,结合真实数据过采样以稳定极端有限目标数据下的适应,不修改基础网络结构。实验在LibriTTS和内部数据集上进行,分别使用两种ZS-TTS源。结果表明,我们的方法在保持语言可理解性和感知质量的同时,优于naive合成数据增强,实现说话人相似性提升。

关键词

引用

@article{arxiv.2603.04219,
  title  = {ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis},
  author = {Youngwon Choi and Jinwoo Oh and Hwayeon Kim and Hyeonyu Kim},
  journal= {arXiv preprint arXiv:2603.04219},
  year   = {2026}
}

备注

6 pages, submitted to INTERSPEECH 2026