中文

一种多语言失语症框架:检测、严重程度分类、语音转文本与干净语音生成

音频与语音处理 2025-10-07 v1 声音

摘要

失语症是一种运动性言语障碍,导致语音缓慢且常常难以理解。言语可理解性显著影响沟通,导致社交交往中的障碍。失语症常为帕金森病和肌萎缩性肌萎缩症(ALS)等神经系统疾病的特征,但当前工具在不同语言和不同严重程度水平上缺乏通用性。本研究提出了一个统一的基于人工智能的多语言框架,解决六个关键问题:(1)二分类失语症检测、(2)严重程度分类、(3)干净语音生成、(4)语音转文本转换、(5)情感检测、(6)语音克隆。我们分析了英文、俄文和德文数据集,利用基于频谱图的可视化和声学特征提取来指导模型训练。我们的二分类检测模型在所有三种语言中实现了97%的准确率,显示出强大的跨语言泛化能力。严重程度分类模型也达到了97%的测试准确率,具有可解释的结果,显示模型注意力集中在较低的谐波上。我们的翻译管道在训练(0.03)和测试(0.06)时均采用较低的 L1 损失,成功重建了可理解的输出。鉴于英文失语症-干净语音对的稀缺性,我们在英语数据上微调了俄语模型,实现了训练损失为0.02、测试损失为0.03的改进,凸显了跨语言迁移学习在资源匮乏情况下的前景。我们的语音转文本管道在三个纪元后实现了0.1367的词错误率(WER),表明对失语症语音的转录准确,能够为后续情感识别和语音克隆提供转录语音。总体而言,本研究的结果和产品可用于诊断失语症,提高不同语言下患者的沟通与理解。

关键词

引用

@article{arxiv.2510.03986,
  title  = {A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation},
  author = {Ananya Raghu and Anisha Raghu and Nithika Vivek and Sofie Budman and Omar Mansour},
  journal= {arXiv preprint arXiv:2510.03986},
  year   = {2025}
}