中文

基于神经网络的细粒度课堂音频活动检测

音频与语音处理 2021-11-11 v2 神经与进化计算 声音

摘要

教师正越来越多地在课堂中采用以学生为中心的学习技术以改善学习成效。除讲授外,这些课程环节包含个体与小组作业形式,以及更高频率的学生—教师互动。量化课堂活动是加速评估与改进创新教学实践的关键要素,但人工标注难以扩展。在本稿件中,我们展示了从音频进行自动课堂活动检测这一新兴应用领域的进展。利用带有九种活动标签(如“讲授”、“小组作业”、“学生提问”)的大学课堂语料库,我们提出并评估了深度全连接、卷积与循环神经网络架构,比较了梅尔滤波器组、OpenSmile 与自监督声学特征的表现。我们将 9 类分类性能与任务的 5 类与 4 类简化版本进行比较,并评估两类泛化能力:(1) 已见教师的新课程场次,与(2) 未见过的教师。我们在新的细粒度任务上取得强劲结果,并在 4 类任务上达到最优:我们的最佳模型在泛化至未见教师时,4 类、5 类与 9 类分类任务的帧级错误率分别为 6.2%、7.7% 与 28.0%(相较强基线相对降低 35.4%、48.3% 与 21.6%)。在估计课堂活动所花费的聚合时间时,我们的平均均方根误差为每节课 1.64 分钟,相较基线相对降低 54.9%。

关键词

引用

@article{arxiv.2107.14369,
  title  = {Fine-Grained Classroom Activity Detection from Audio with Neural Networks},
  author = {Eric Slyman and Chris Daw and Morgan Skrabut and Ana Usenko and Brian Hutchinson},
  journal= {arXiv preprint arXiv:2107.14369},
  year   = {2021}
}