中文

探索多模态课堂数据的指令活动与话语自动识别

计算机视觉与模式识别 2025-12-12 v2

摘要

课堂互动的观察可以为教师提供具体反馈,但当前方法依赖手动标注,耗费资源且难以扩展。本文探讨了基于人工智能的课堂录像分析,聚焦于多模态指令活动和话语识别,以构建可操作的反馈系统。我们使用由 164 小时视频和 68 节课堂讲稿构成的密集标注数据集,设计了平行的、模态特定的管线。对于视频,我们评估了零样本多模态大语言模型、微调的视觉语言模型和自监督视频变换器在 24 个活动标签上的表现。对于讲稿,我们对基于变换器的分类器进行微调,并将其与基于提示的大语言模型在 19 个话语标签上进行比较。为处理类别不平衡和多标签复杂性,我们应用了 per-label阈值、上下文窗口和不平衡感知损失函数。结果表明,微调模型在零样本方法中一致表现更佳,视频得分达到 0.577,讲稿得分达到 0.460。这些结果表明了自动化课堂分析的可行性,为可扩展的教师反馈系统奠定了基础。

关键词

引用

@article{arxiv.2512.00087,
  title  = {Exploring Automated Recognition of Instructional Activity and Discourse from Multimodal Classroom Data},
  author = {Ivo Bueno and Ruikun Hou and Babette Bühler and Tim Fütterer and James Drimalla and Jonathan Kyle Foster and Peter Youngs and Peter Gerjets and Ulrich Trautwein and Enkelejda Kasneci},
  journal= {arXiv preprint arXiv:2512.00087},
  year   = {2025}
}

备注

This article has been accepted for publication in the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026