WhisperD:基于 Whisper 的痴呆症语音识别与填充词检测
音频与语音处理
2025-05-29 v1 人工智能
机器学习
声音
摘要
Whisper 无法正确转录痴呆症语音,因为痴呆症患者(PwD)经常表现出不规则的语音模式和不流利现象,如停顿、重复和破碎的句子。它是在标准语音上训练的,可能很少或根本没有接触过受痴呆症影响的语音。然而,正确的转录对于痴呆症语音至关重要,这有助于经济高效的诊断和辅助技术的开发。在这项工作中,我们使用开源的痴呆症语音数据集(DementiaBank)和我们的内部数据集对 Whisper 进行微调,以提高其词错率(WER)。微调还包括填充词,以确定填充词包含率(FIR)和 F1 分数。微调后的模型显著优于现成模型。中等规模的模型达到了 0.24 的 WER,超越了之前的工作。同样,它对未见过的数据和语音模式表现出了显著的泛化能力。
引用
@article{arxiv.2505.21551,
title = {WhisperD: Dementia Speech Recognition and Filler Word Detection with Whisper},
author = {Emmanuel Akinrintoyo and Nadine Abdelhalim and Nicole Salomons},
journal= {arXiv preprint arXiv:2505.21551},
year = {2025}
}
备注
Submitted to Interspeech 2025 (Accepted)