Whisper 在临床实践中的应用:术后病中命名任务的语音评估
声音
2025-10-30 v2 音频与语音处理
摘要
对中风后语言功能受损的详细评估仍然是认知复杂且需要临床医生工作的任务,这限制了及时且可扩展的诊断。自动语音识别(ASR)基础模型通过智能系统来增强人类评估,是一个值得期待的路径,但其在语音和语言受损情境下的效果尚不确定。本研究评估了Whisper——一种最先进的ASR基础模型——是否可以应用于对中风患者在常用图像命名任务中的语音转录和分析。我们评估了其在逐字转录准确性以及支持下游语言功能预测能力,后者对中风后结果具有重大意义。我们的结果表明,基线Whisper模型在单字语音输入方面表现不佳。然而,对Whisper进行微调后,转录准确性显著提高(在健康语音中将词错误率降低87.72%,在中风患者语音中降低71.22%)。进一步地,模型学到的表征能够实现对语音质量的准确预测(健康语音的平均F1宏平均值为0.74,中风患者为0.75)。然而,在未见的(TORGO)数据集上的评估揭示了其在跨域泛化性有限,突显了Whisper在零样本转录单字语音方面无法在领域外临床语音上正常工作,强调了需为特定临床人群调整模型的必要性。尽管跨域泛化仍面临挑战,这些发现表明,在得到恰当微调后,基础模型有潜力推动中风相关功能受损的自动化语音和语言评估及康复。
引用
@article{arxiv.2507.17326,
title = {Application of Whisper in Clinical Practice: the Post-Stroke Speech Assessment during a Naming Task},
author = {Milena Davudova and Ziyuan Cai and Valentina Giunchiglia and Dragos C. Gruia and Giulia Sanguedolce and Adam Hampshire and Fatemeh Geranmayeh},
journal= {arXiv preprint arXiv:2507.17326},
year = {2025}
}