中文

用于失语性说话人合成语音的人声克隆:解决言语语言病学中的数据稀缺问题

声音 2025-03-04 v1 人工智能 音频与语音处理

摘要

本研究探索了人声克隆技术,以生成复现失语性说话人独特语音模式的合成语音。基于TORGO数据集,我们解决了言语语言病学中的数据稀缺和隐私保护挑战。我们的贡献包括:证明人声克隆保留了失语性说话特征,分析了真实数据与合成数据之间的差异,以及讨论了对诊断、康复和沟通的影响。我们使用商业平台为失语性和对照说话人克隆语音,确保性别匹配的合成语音。一名执业言语语言病学家(SLP)评估了部分样本以识别失语、说话人性别和合成指示器。SLP在所有案例中均正确识别了失语,在95%的情况下正确识别了说话人性别,但将30%的合成样本误分类为真实,表明其高度逼真。我们的结果表明,合成语音有效地捕捉了无序特征,人声克隆已发展到能够产生与真实语音相似的高质量数据,甚至能被经过训练的专业人员识别。这在医疗保健方面具有重要意义,合成数据可缓解数据稀缺、保护隐私并提升AI驱动的诊断能力。通过实现多样化、高质量语音数据集的创建,人声克隆可以改进通用模型、个性化治疗,并推动失语的辅助技术的发展。我们公开发布了合成数据集,以促进进一步的研究和合作,旨在开发出能改善言语语言病学中患者结果的健壮模型。

关键词

引用

@article{arxiv.2503.01266,
  title  = {Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology},
  author = {Birger Moell and Fredrik Sand Aronsson},
  journal= {arXiv preprint arXiv:2503.01266},
  year   = {2025}
}