When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
人工智能
2026-05-05 v1 计算与语言
音频与语音处理
摘要
自动语音识别(ASR)系统在治疿性语音和其他非典型语音上仍显脆弱。近期的音频语言模型有望通过在推理时对额外的临床上下文进行条件化来提高性能,但目前尚不清楚这些模型是否能够有效利用此类信息。我们构建了一个基于Speech Accessibility Project(SAP)数据集的基准测试,测试诊断标签、临床医生提取的语音评分以及逐步丰富的临床描述是否能提高治疿性语音的转录准确率。在九个模型的匹配比较中,我们发现当前模型未能有效利用此类上下文:诊断信息化和临床细节提示均仅产生微小的改进,甚至常常会导致词错误率的恶化。我们对提示分析进行了补充,同时进行了上下文依赖的微调,显示出LoRA在混合临床提示格式下的适配能够实现0.066的WER,这相当于冻结基线的52%相对降低,同时在上下文不可用时仍保持良好性能。亚组分析揭示了Down syndrome和轻度严重程度说话者获得显著提升。这一结果阐明了当前模型的不足之处,为衡量更包容性ASR的进展提供了测试平台。
引用
@article{arxiv.2605.02782,
title = {When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition},
author = {Pehuén Moure and Niclas Pokel and Bilal Bounajma and Yingqiang Gao and Roman Boehringer and Longbiao Cheng and Shih-Chii Liu},
journal= {arXiv preprint arXiv:2605.02782},
year = {2026}
}