LearnerVoice:非母语英语学习者自发语音数据集
计算与语言
2024-10-07 v2 声音
音频与语音处理
摘要
第二语言(L2)学习者的自发语音中常见的不完整表达和语流错误为自动语音识别(ASR)系统带来了独特挑战。然而,针对L2学习者语音的语音数据集寥寥无几。我们公开发布了LearnerVoice数据集,包含50.04小时的音频及其转录文本。我们的语言学分析表明,本数据集中的转录文本包含L2S(L2学习者自发语音)特征,包括不完整表达和语流错误(如填充词、词语重复、自我修正、误开头句),远多于母语语音数据集。使用LearnerVoice对whisper-small.en进行微调,可实现10.26%的词错误率(WER),比原始模型降低44.2%。此外,我们的定性分析表明,vanilla模型在LearnerVoice上的54.2%的错误可归因于L2S特征,其中48.1%已在微调后模型中被纠正。
引用
@article{arxiv.2407.04280,
title = {LearnerVoice: A Dataset of Non-Native English Learners' Spontaneous Speech},
author = {Haechan Kim and Junho Myung and Seoyoung Kim and Sungpah Lee and Dongyeop Kang and Juho Kim},
journal= {arXiv preprint arXiv:2407.04280},
year = {2024}
}
备注
Proceedings of Interspeech