中文

利用前沿语音模型评估加纳学生的口语阅读流畅度

计算与语言 2023-10-27 v1 人工智能

摘要

本文报告了三组近期实验,利用大规模语音模型评估加纳学生的口语阅读流畅度(ORF)。尽管 ORF 是基础性读写能力的成熟衡量指标,但其评估通常需要学生与训练有素的评价者进行一对一会话,这一过程耗时且昂贵。自动化 ORF 评估可支持更好的读写教学,尤其是在因班级规模大和资源有限而很少进行形成性评估的教育环境中。据我们所知,本研究是最早考察最新版本大规模语音模型(Whisper V2、wav2vec2.0)在全球南方用于 ORF 评估的研究之一。我们发现 Whisper V2 对加纳学生大声朗读的转写词错率(WER)为 13.5。这接近该模型在成人语音上的平均 WER(12.8),且在几年前仍会被视为儿童语音转写的 SOTA 水平。我们还发现,当使用这些转写生成完全自动化的 ORF 分数时,它们与专家人工评分者给出的分数高度一致,相关系数为 0.96。重要的是,这些结果是在具有代表性的数据集上(即带有地区口音的学生、在实际课堂中录制的录音)使用免费公开可用的语音模型开箱即用(即无微调)取得的。这表明,在资源较少、语言多样化的教育环境中,使用大规模语音模型评估 ORF 可能具备可行性与可扩展性。

关键词

引用

@article{arxiv.2310.17606,
  title  = {Using State-of-the-Art Speech Models to Evaluate Oral Reading Fluency in Ghana},
  author = {Owen Henkel and Hannah Horne-Robinson and Libby Hills and Bill Roberts and Joshua McGrane},
  journal= {arXiv preprint arXiv:2310.17606},
  year   = {2023}
}