中文

保留错误的英语初学者自动语音识别

计算与语言 2024-06-06 v1 人工智能

摘要

语言学习者需要练习的核心技能之一是口语。目前,学生在学校缺乏足够的口语机会和会话练习。语音技术和自然语言处理的最新进展使得创建练习口语技能的新工具成为可能。在这项工作中,我们处理了此类流程的第一个组件,即自动语音识别模块(ASR),它面临若干挑战:首先,最先进的ASR模型通常使用母语者的成人朗读数据进行训练,不能很好地迁移到年轻语言学习者的语音。其次,大多数ASR系统包含强大的语言模型,会平滑说话者所犯的错误。为了提供纠正性反馈(这是语言学习的关键部分),我们环境中的ASR系统需要保留语言学习者所犯的错误。在这项工作中,我们构建了一个满足这些要求的ASR系统:它适用于年轻语言学习者的自发语音,并保留他们的错误。为此,我们收集了一个包含约85小时英语音频的语料库,这些音频由瑞士4至6年级的学习者在不同的语言学习任务中录制,我们使用该语料库训练了一个ASR模型。我们的实验表明,我们的模型受益于对儿童语音的直接微调,并且错误保留率远高于其他模型。

关键词

引用

@article{arxiv.2406.03235,
  title  = {Error-preserving Automatic Speech Recognition of Young English Learners' Language},
  author = {Janick Michot and Manuela Hürlimann and Jan Deriu and Luzia Sauer and Katsiaryna Mlynchyk and Mark Cieliebak},
  journal= {arXiv preprint arXiv:2406.03235},
  year   = {2024}
}

备注

Accepted at ACL 2024 Main Conference