基于自训练方法的 Whisper 模型长时失语者语音识别增强
声音
2025-07-01 v1 音频与语音处理
摘要
失语者语音识别(DSR)通过提升智能设备的可访问性,使具有受限运动能力的失语者能够使用。以往的 DSR 研究受限于现有数据集通常仅包含孤立单词、命令短语及少数几人的有限句子,导致研究局限于命令交互系统和说话人适应。Speech Accessibility Project(SAP)通过发布大规模且多样化的英语失语者语音数据集,改变了这一局限,推动了 SAP 挑战赛,以构建面向说话人和文本无关的 DSR 系统。我们通过一种新型自训练方法增强了 Whisper 模型在长时失语者语音识别中的性能。该方法增加了训练数据,并适配模型以处理推断期间可能遇到的不完整语音片段。我们的系统在 SAP 挑战赛中在词错误率和语义得分方面均获得第二名。
引用
@article{arxiv.2506.22810,
title = {A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition},
author = {Shiyao Wang and Jiaming Zhou and Shiwan Zhao and Yong Qin},
journal= {arXiv preprint arXiv:2506.22810},
year = {2025}
}
备注
accepted by Interspeech 2025