Speak & Improve 语料库 2025:用于语言评估与反馈的 L2 英语口语语料库
计算与语言
2024-12-18 v2
摘要
我们介绍了 Speak & Improve 语料库 2025,这是一个包含整体评分和语言错误标注的 L2 学习者英语数据集,收集自 Speak & Improve 学习平台上的开放式(自发)口语测试。发布该语料库的目的是解决开发 L2 口语处理系统面临的一项重大挑战,即缺乏具有高质量标注的公开数据。该语料库可在 ELiT 网站上供非商业使用。在设计该语料库时,我们力求使其涵盖广泛的说话人属性,从他们的母语(L1)到口语能力,并提供手动标注。这使得我们能够研究各种语言学习任务,例如评估口语水平或对学习者口语中的语法错误提供反馈。此外,该数据还支持这些任务所需的底层技术研究,包括低资源 L2 学习者英语的自动语音识别(ASR)、不流利检测或口语语法错误纠正(GEC)。该语料库包含约 315 小时带有整体评分的 L2 英语学习者音频,以及一个带有转录和错误标签的音频子集。
引用
@article{arxiv.2412.11986,
title = {Speak & Improve Corpus 2025: an L2 English Speech Corpus for Language Assessment and Feedback},
author = {Kate Knill and Diane Nicholls and Mark J. F. Gales and Mengjie Qian and Pawel Stroinski},
journal= {arXiv preprint arXiv:2412.11986},
year = {2024}
}