中文

大型语音模型 Parler TTS 能否重建失语者语音?

音频与语音处理 2025-09-26 v1 计算与语言 声音

摘要

语言障碍会使患者的沟通变得困难甚至不可能。个性化文本转语音是一种吸引人的沟通辅助工具。我们尝试使用大型语音模型进行语音重建,通过该模型生成失语者语音在其病情发展前的近似语音。具体而言,我们调查了最先进的大型语音模型 Parler TTS 是否能够在保持说话人身份的同时生成可理解的语音。我们构建了一个数据集并标注了相关的说话人信息和可理解性信息,并用于微调模型。我们的结果表明,该模型确实能够从这一具有挑战性的数据分布中进行学习,但在控制可理解性和保持一致的说话人身份方面存在困难。我们提出了未来方向,以提高这类模型在语音重建任务中的可控性。

关键词

引用

@article{arxiv.2506.04397,
  title  = {Can we reconstruct a dysarthric voice with the large speech model Parler TTS?},
  author = {Ariadna Sanchez and Simon King},
  journal= {arXiv preprint arXiv:2506.04397},
  year   = {2025}
}

备注

Accepted at Interspeech 2025