中文

基于原型的解耦用于可控构音障碍语音合成

声音 2026-02-20 v2 计算与语言

摘要

构音障碍语音表现出高变异性和有限的标注数据,这对自动语音识别(ASR)和辅助语音技术都构成了重大挑战。现有方法依赖于合成数据增强或语音重建,但常常将说话人身份与病理性发音纠缠在一起,限制了可控性和鲁棒性。在本文中,我们提出ProtoDisent-TTS,一个基于原型的解耦TTS框架,它构建在预训练的文本到语音骨干网络上,在统一的潜在空间内分解说话人音色和构音障碍发音。一个病理原型码本提供了健康和构音障碍语音模式的可解释和可控表示,而一个带有梯度反转层的双分类器目标强制说话人嵌入对病理属性具有不变性。在TORGO数据集上的实验表明,这种设计实现了健康和构音障碍语音之间的双向转换,从而带来一致的ASR性能提升以及鲁棒的、感知说话人的语音重建。

关键词

引用

@article{arxiv.2602.08696,
  title  = {Prototype-Based Disentanglement for Controllable Dysarthric Speech Synthesis},
  author = {Haoshen Wang and Xueli Zhong and Bingbing Lin and Jia Huang and Xingduo Pan and Shengxiang Liang and Nizhuan Wang and Wai Ting Siok},
  journal= {arXiv preprint arXiv:2602.08696},
  year   = {2026}
}