中文

USAT:一种通用说话人自适应文本到语音方法

声音 2024-04-30 v1 人工智能 计算与语言 音频与语音处理

摘要

传统文本到语音 (TTS) 研究主要侧重于提升训练数据集中说话人的合成语音质量。为未见过的、数据集外的说话人(尤其是那些参考数据有限的说话人)合成逼真语音的挑战,仍然是一个重大且尚未解决的问题。虽然零样本或少样本说话人自适应 TTS 方法已被探索,但它们存在诸多局限。零样本方法往往泛化性能不足,难以再现带有浓重口音的说话人的声音。而少样本方法虽能再现高度变化的口音,却带来了显著的存储负担以及过拟合和灾难性遗忘的风险。此外,先前的方法仅提供零样本或少样本自适应中的一种,限制了它们在不同需求的各种真实场景中的实用性。另外,当前大多数说话人自适应 TTS 的评估仅在母语者数据集上进行,无意中忽略了大量具有不同口音的非母语者。我们提出的框架统一了零样本和少样本说话人自适应策略,根据其优点我们分别称之为“即时”和“细粒度”自适应。为缓解零样本说话人自适应中观察到的泛化性能不足问题,我们设计了两个创新的判别器,并为语音解码器引入了一种记忆机制。为防止少样本说话人自适应中的灾难性遗忘并减少存储影响,我们设计了两个适配器和一个独特的自适应流程。

关键词

引用

@article{arxiv.2404.18094,
  title  = {USAT: A Universal Speaker-Adaptive Text-to-Speech Approach},
  author = {Wenbin Wang and Yang Song and Sanjay Jha},
  journal= {arXiv preprint arXiv:2404.18094},
  year   = {2024}
}

备注

15 pages, 13 figures. Copyright has been transferred to IEEE