中文

Kid-Whisper:缩小儿童与成人自动语音识别性能差距

音频与语音处理 2024-05-16 v3 计算与语言 声音

摘要

以 Whisper 为代表的自动语音识别(ASR)系统近期取得的进展表明,在充足数据下这类系统有接近人类水平的潜力。然而,由于适合的儿童专用数据库有限且儿童语音具有鲜明特征,这一进展难以直接推广到儿童 ASR。近期一项研究探索利用 My Science Tutor(MyST)儿童语音语料库来提升 Whisper 识别儿童语音的性能,并在有限的测试集上展示了一定改进。本文在此基础上通过更高效的数据预处理增强 MyST 数据集的效用。我们使用 Whisper-Small 将 MyST 测试集上的词错误率(WER)从 13.93% 降至 9.11%,使用 Whisper-Medium 从 13.23% 降至 8.61%,并表明该改进可泛化至未见过的数据集。我们还强调了提升儿童 ASR 性能的重要挑战。结果展示了将 Whisper 可行且高效地集成用于有效儿童语音识别。

关键词

引用

@article{arxiv.2309.07927,
  title  = {Kid-Whisper: Towards Bridging the Performance Gap in Automatic Speech Recognition for Children VS. Adults},
  author = {Ahmed Adel Attia and Jing Liu and Wei Ai and Dorottya Demszky and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2309.07927},
  year   = {2024}
}