谁说了什么?学前教室语音分析的自动化方法
音频与语音处理
2024-10-29 v3 机器学习
摘要
幼儿在清醒时的大部分时间都待在嘈杂的学前教室里。在这些环境中,儿童与教师的声音互动是其语言结果的关键贡献因素,但手动转录这些互动是不可行的。利用儿童和教师佩戴的录音设备,我们提出了一个自动化框架,该框架使用开源软件对说话人进行分类(ALICE)并转录其话语(Whisper)。我们将框架的结果与人类专家对110分钟课堂录音的结果进行比较,其中包括来自儿童佩戴麦克风的85分钟(n=4名儿童)和来自教师佩戴麦克风的25分钟(n=2名教师)。总体一致比例(即正确分类的教师和儿童话语的比例)为0.76,误差校正kappa为0.50,加权F1为0.76。教师和儿童转录的词错误率均为0.15,这意味着需要删除、添加或更改15%的单词才能使Whisper转录与专家转录相等。此外,从专家转录和自动转录中分别计算的话语特征,如平均话语长度(以词计)、教师和儿童话语中疑问句的比例,以及在2.5秒内得到回应的比例,结果相似。结果表明,在分析可能支持儿童语言发展的课堂语音方面取得了实质性进展。目前正在进行使用自然语言处理的未来研究,以改进说话人分类,并分析将自动化框架应用于更大数据集的结果,该数据集包含一年内17次观察中13名儿童和3名教师的课堂录音。
引用
@article{arxiv.2401.07342,
title = {Who Said What? An Automated Approach to Analyzing Speech in Preschool Classrooms},
author = {Anchen Sun and Juan J Londono and Batya Elbaum and Luis Estrada and Roberto Jose Lazo and Laura Vitale and Hugo Gonzalez Villasanti and Riccardo Fusaroli and Lynn K Perry and Daniel S Messinger},
journal= {arXiv preprint arXiv:2401.07342},
year = {2024}
}
备注
8 pages, 4 figures, 3 tables, The paper has been accepted to 2024 IEEE International Conference on Development and Learning (ICDL) as a full oral presentation and will appear in the IEEE ICDL proceedings