MOSLA项目:记录第二语言习得的每一刻
计算与语言
2024-03-27 v1
摘要
第二语言习得(SLA)是一个复杂且动态的过程。许多试图记录和分析这一过程的SLA研究通常只关注单一模态(例如,学习者的文本输出),仅覆盖较短的时间周期,并且/或者缺乏控制(例如,未能捕捉学习过程的每一个方面)。在MOSLA(第二语言习得时刻)项目中,我们创建了一个纵向、多模态、多语言且受控的数据集,方法是邀请参与者从零开始学习三种目标语言(阿拉伯语、西班牙语和汉语)中的一种,时间跨度为两年,完全通过在线教学进行,并使用Zoom录制每一节课。该数据集由人类标注者和经过微调的最先进语音模型半自动地标注了说话人/语言ID和转录文本。我们的实验揭示了学习者随时间推移熟练度发展的语言学见解,以及仅从未标注的多模态数据中自动检测屏幕关注区域的潜力。我们的数据集可免费用于研究目的,并可作为广泛应用的宝贵资源,包括但不限于SLA、熟练度评估、语言与语音处理、教育学和多模态学习分析。
引用
@article{arxiv.2403.17314,
title = {Project MOSLA: Recording Every Moment of Second Language Acquisition},
author = {Masato Hagiwara and Joshua Tanner},
journal= {arXiv preprint arXiv:2403.17314},
year = {2024}
}
备注
Accepted at LREC-COLING 2024