利用提示词改进儿童语音识别与朗读错误检测
音频与语音处理
2025-09-01 v1 人工智能
计算与语言
声音
摘要
自动朗读评估可以通过更高效地对朗读练习进行评分为教师提供有价值的支持。然而,关于朗读评估系统及其应用的研究仍然有限。我们提出了一种新颖的多模态方法,利用音频和来自文本资源的知识。具体而言,我们探索了使用 Whisper 和经过指令微调的大语言模型(LLMs)结合提示词来改进儿童语音识别转录的潜力,以及它们在下游朗读错误检测中的有效性。我们的结果证明了提示 Whisper 和提示 LLM 相比于无提示的基线 Whisper 模型的有效性。表现最佳的系统在荷兰语儿童朗读语音中达到了 SOTA 的识别性能,词错误率(WER)为 5.1%,将 9.4% 的基线 WER 显著降低。此外,它显著改善了朗读错误检测,将 F1 分数从 0.39 提高到了 0.73。
引用
@article{arxiv.2506.11079,
title = {Improving Child Speech Recognition and Reading Mistake Detection by Using Prompts},
author = {Lingyun Gao and Cristian Tejedor-Garcia and Catia Cucchiarini and Helmer Strik},
journal= {arXiv preprint arXiv:2506.11079},
year = {2025}
}
备注
This paper is accepted to Interspeech 2025. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants which is financed by the Dutch Research Council (NWO)