中文

DiaMoE-TTS:基于统一IPA的方言语音合成框架,融合专家混合与参数高效零样本自适应

声音 2025-09-30 v1 计算与语言 音频与语音处理

摘要

方言语音体现了丰富的文化和语言多样性,然而由于数据稀缺、正字法不一致以及复杂的语音变异,为方言构建文本到语音(TTS)系统仍然具有挑战性。为了解决这些问题,我们提出了DiaMoE-TTS,这是一个基于国际音标(IPA)的统一框架,它标准化了语音表示并解决了字素到音素的歧义。该系统基于F5-TTS架构构建,引入了一种方言感知的专家混合(MoE)来模拟音系差异,并采用参数高效的自适应方法,利用低秩适配器(LoRA)和条件适配器快速迁移到新的方言。与依赖大规模或专有资源的方法不同,DiaMoE-TTS实现了可扩展的、开放数据驱动的合成。实验证明了自然且富有表现力的语音生成,仅在数小时数据的情况下,就在未见过的方言和京剧等专业领域实现了零样本性能。

关键词

引用

@article{arxiv.2509.22727,
  title  = {DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation},
  author = {Ziqi Chen and Gongyu Chen and Yihua Wang and Chaofan Ding and Zihao chen and Wei-Qiang Zhang},
  journal= {arXiv preprint arXiv:2509.22727},
  year   = {2025}
}

备注

5 pages, 2 figures