面向课堂场景的学生行为识别:新数据集与基线方法
计算机视觉与模式识别
2025-03-10 v2
摘要
分析学生行为是教育研究中的重要且具有挑战性的任务。现有工作受限于缺乏可访问的数据集来捕捉课堂环境中细腻的动作动态。本文提出一个新的多标签学生行为视频(SAV)数据集,专为课堂场景中的行为检测设计。SAV 数据集由 758 个不同教室的 4324 个精心裁剪视频片段组成,标注为 15 种 distinct 学生行为。与现有行为检测数据集相比,SAV 数据集突出之处在于提供广泛的真实课堂场景、高质量视频数据以及独特挑战,包括细微运动差异、密集物体交互、显著尺度差异、多样化拍摄角度以及视觉遮挡。这些复杂性为推动行为检测方法的发展带来了新的机遇和挑战。为基准测试,本文提出一种基于视觉转换器的新颖基线方法,旨在增强对小密集物体区域中关键局部细节的注意力。该方法在 SAV 和 AVA 数据集上分别实现了 67.9% 和 27.4% 的平均精度(mAP)。本文不仅提供数据集,也呼吁进一步研究基于 AI 的教育工具,这些工具可能变革教学方法论和学习成果。代码和数据集已发布于 https://github.com/Ritatanz/SAV。
引用
@article{arxiv.2409.00926,
title = {Towards Student Actions in Classroom Scenes: New Dataset and Baseline},
author = {Zhuolin Tan and Chenqiang Gao and Anyong Qin and Ruixin Chen and Tiecheng Song and Feng Yang and Deyu Meng},
journal= {arXiv preprint arXiv:2409.00926},
year = {2025}
}