中文

利用知识锚定和课程学习促进失语者个性化语音合成

声音 2025-09-26 v2

摘要

失语者因运动控制受损导致语音器官受阻,造成沟通困难,严重影响语音可理解性。这给数据策展工作带来重大挑战,因为实际录制长篇流畅句子以训练针对目标失语者的个性化TTS模型变得不可行。此外,音频数据的稀缺性以及音频中存在的说唤错误,使得针对目标失语者的语音合成变得复杂。为此,我们将问题定义为域迁移任务,引入知识锚定框架,利用教师-学生模型并通过音频增强实现课程学习。实验结果表明,所提出的零样本多说话人TTS模型有效生成语音,显著减少说唤错误,保持说话人风格,同时维持语调的自然性。

关键词

引用

@article{arxiv.2508.10412,
  title  = {Facilitating Personalized TTS for Dysarthric Speakers Using Knowledge Anchoring and Curriculum Learning},
  author = {Yejin Jeon and Solee Im and Youngjae Kim and Gary Geunbae Lee},
  journal= {arXiv preprint arXiv:2508.10412},
  year   = {2025}
}

备注

Interspeech 2025