利用知识锚定和课程学习促进失语者个性化语音合成
声音
2025-09-26 v2
摘要
失语者因运动控制受损导致语音器官受阻,造成沟通困难,严重影响语音可理解性。这给数据策展工作带来重大挑战,因为实际录制长篇流畅句子以训练针对目标失语者的个性化TTS模型变得不可行。此外,音频数据的稀缺性以及音频中存在的说唤错误,使得针对目标失语者的语音合成变得复杂。为此,我们将问题定义为域迁移任务,引入知识锚定框架,利用教师-学生模型并通过音频增强实现课程学习。实验结果表明,所提出的零样本多说话人TTS模型有效生成语音,显著减少说唤错误,保持说话人风格,同时维持语调的自然性。
引用
@article{arxiv.2508.10412,
title = {Facilitating Personalized TTS for Dysarthric Speakers Using Knowledge Anchoring and Curriculum Learning},
author = {Yejin Jeon and Solee Im and Youngjae Kim and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2508.10412},
year = {2025}
}
备注
Interspeech 2025