儿童语音转录:ASR性能与获取可靠正字稿
计算与语言
2026-05-29 v1 人工智能
摘要
自动语音识别(ASR)有望通过生成自动转录显著减少儿童语音研究中的手动标注工作。然而,在低资源语言中,由于缺乏儿童专用的预训练模型和高度多样的噪声条件,获取儿童语音的高质量ASR转录仍具有挑战性。本研究通过两个研究问题探讨了最先进ASR模型在儿童语音上的有效性,通过在两个荷兰儿童语音数据集(JASMIN和DART)上评估九个来自三个模型家族(Whisper、Parakeet和Wav2Vec2)的ASR模型。研究问题1检验了应用于儿童语音的ASR模型性能。微调的Whisper-medium模型实现了最佳整体性能,在JASMIN上WER为5.54%,在DART上为70.37%,表明噪声较大的DART数据显然更具挑战性。研究问题2检验了在无需手动验证的情况下,能否获得可靠的正字稿。我们使用 utterance级别的选择方法,将ASR输出与原始读作提示进行比较,以识别正确发音的录音。通过提出的选择方法,JASMIN可自动识别42.0%的utterance,DART为18.1%,结果在utterance级别上精度达到98.3%以上,大幅减少了对手动验证的需求。
引用
@article{arxiv.2605.28833,
title = {Transcribing Children's Speech: ASR Performance and Obtaining Reliable Orthographic Transcriptions},
author = {Gus Lathouwers and Lingyun Gao and Catia Cucchiarini and Helmer Strik},
journal= {arXiv preprint arXiv:2605.28833},
year = {2026}
}