中文

鲁棒跨病因和说话人独立的语颤 speech识别

声音 2025-01-28 v1 人工智能 机器学习 音频与语音处理

摘要

本文提出了一个说话人独立的语颤语音识别系统,聚焦于评估最新发布的 Speech Accessibility Project (SAP-1005) 数据集,该数据集包含来自帕金森病 (PD) 患者的语音数据。尽管语颤语音识别领域已有大量研究,但许多现有系统是说话人依赖且自适应的,这限制了其在不同说话人和病因之间的泛化能力。我们的主要目标是开发一种鲁棒的说话人独立模型,能够准确识别来自不同说话人的语颤语音。此外,作为次要目标,我们测试了该模型在跨病因情景下的性能,通过在包含小脑肌麻痹 (CP) 和肌萎缩性肌肉神经营养不良 (ALS) 患者语音的 TORGO 数据集进行评估。利用 Whisper 模型,我们的说话人独立系统在 SAP-1005 数据集上实现了 6.99% 的字错率 (CER) 和 10.71% 的词错率 (WER)。在跨病因设置下,我们在 TORGO 数据集上实现了 25.08% 的 CER 和 39.56% 的 WER。这些结果凸显了该方法在面对未见说话人和不同语颤病因时具有良好泛化潜力。

关键词

引用

@article{arxiv.2501.14994,
  title  = {Robust Cross-Etiology and Speaker-Independent Dysarthric Speech Recognition},
  author = {Satwinder Singh and Qianli Wang and Zihan Zhong and Clarion Mendes and Mark Hasegawa-Johnson and Waleed Abdulla and Seyed Reza Shahamiri},
  journal= {arXiv preprint arXiv:2501.14994},
  year   = {2025}
}

备注

Accepted to ICASSP 2025