中文

基于自监督语音表示中语音子空间分析的无训练跨语言语音重度损伤严重程度评估

计算与语言 2026-04-14 v1 机器学习

摘要

语音重度损伤严重程度评估通常需要专业临床医生或基于标记路径ological语音构建的监督模型,这限制了跨语言和临床环境的可扩展性。我们提出一种无训练方法,通过衡量冻结 HuBERT 表示中语音子空间退化程度来量化语音重度损伤严重程度。该方法无需训练监督严重程度模型;从健康对照语音中估计特征方向。对每个说话者,提取通过孟加拉强制对齐器(Montreal Forced Aligner)获得的电话级别嵌入,计算沿从健康对照中唯一派生的语音对比方向(鼻化、声门、尖声、响度、方式以及四个元音特征)的 d-prime 分数,并构建 12 维语音轮廓。我们在 890 名说话者、10 个语料库、5 种语言(英语、西班牙语、荷兰语、普通话、法语)和 3 种主要病因(帕金森病、脑瘤、肌萎缩性肌萎缩症)上进行评估。结果发现,所有五个辅音 d-prime 特征与临床严重程度显著相关(随机效应 meta 分析 rho = -0.50 到 -0.56, p < 2e-4;汇总 Spearman rho = -0.47 到 -0.55,bootstrap 95% 置信区间未越界)。该效应在单个语料库内复制,经过 FDR 校正后仍稳健,留一语料库删除和对齐质量控制后仍稳固。在 6 个严重程度分层语料库中,鼻化 d-prime 从对照到重度损伤呈单调递减。Mann-Whitney U 检验证明,所有 12 个特征均能区分对照者和重度损伤者(p < 0.001)。该方法无需路径ological 训练数据,可应用于任何已有 MFA 声学模型(目前覆盖 29 种语言)的语言。我们公开了完整管道及六种语言的电话特征配置。

关键词

引用

@article{arxiv.2604.10123,
  title  = {Training-Free Cross-Lingual Dysarthria Severity Assessment via Phonological Subspace Analysis in Self-Supervised Speech Representations},
  author = {Bernard Muller and Antonio Armando Ortiz Barrañón and LaVonne Roberts},
  journal= {arXiv preprint arXiv:2604.10123},
  year   = {2026}
}

备注

Submitted to PLOS digital health