中文

情境至关重要:通过VLM动作解析与LLM序列分类进行同伴感知的学生行为投入度测量

计算机视觉与模式识别 2026-05-01 v4 人工智能

摘要

理解课堂中的学生行为对于提高教学质量和学生投入度至关重要。现有的学生投入度预测方法通常需要大量标注数据来建模学生行为的多样性,然而隐私问题常常将研究者限制在自己的专有数据集上。此外,由同伴行为所代表的课堂情境被忽略了。为了解决上述局限性,我们提出了一种新颖的三阶段视频学生投入度测量框架。首先,我们探索了视觉语言模型在学生动作识别中的少样本适应,该模型通过少量训练样本进行微调以区分不同动作类别。其次,为了处理连续且不可预测的学生动作,我们利用滑动时间窗口技术将每个学生的2分钟长视频划分为不重叠的片段。每个片段通过微调后的VLM模型被赋予一个动作类别,从而生成一个动作预测序列。最后,我们利用大语言模型将该完整动作序列连同课堂情境一起分类为投入或未投入的学生。实验结果证明了所提方法在识别学生投入度方面的有效性。源代码将发布于 https://github.com/ahmed-nady/context_aware_student_engagement。

关键词

引用

@article{arxiv.2601.06394,
  title  = {Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification},
  author = {Ahmed Abdelkawy and Ahmed Elsayed and Asem Ali and Aly Farag and Thomas Tretter and Michael McIntyre},
  journal= {arXiv preprint arXiv:2601.06394},
  year   = {2026}
}

备注

accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026