中文

利用视觉-语言模型检测教育视频中的注意力

计算机视觉与模式识别 2026-05-21 v1 人工智能

摘要

教育视频是远程和混合学习的基石。然而,学习者波动的注意力仍然是有效信息保留的一个重大障碍。先前的研究试图通过使用眼动追踪在运行时检测注意力丧失并做出反应来缓解这一问题。迄今为止,此类检测基于在工程化特征(例如学习者注视和眼跳的汇总统计量)上训练的经典机器学习分类器。这些方法难以捕捉学习者参与度的复杂时间特性,因此表现出中等的预测性能。在本研究中,我们旨在通过从标准工程化特征转向多模态基础模型来推进注意力检测。使用一个教育眼动追踪数据集(N = 70),我们研究了一种新颖的方法,该方法利用视觉-语言模型(VLM)直接分析带有叠加注视数据的视频内容。此方法旨在利用基础模型的语义推理能力,将学习者的焦点置于视频流的上下文中。我们使用 Gemini 3 的几种提示策略评估了这种基于 VLM 的方法的性能,但最终发现没有一种策略能超越统计基线。我们的结果为使用 VLM 进行实时教育诊断的局限性提供了新的见解。

关键词

引用

@article{arxiv.2605.20211,
  title  = {Leveraging Vision-Language Models to Detect Attention in Educational Videos},
  author = {Gabriel Becquet and Sébastien Lallé and Vanda Luengo and Ali Abou-Hassan},
  journal= {arXiv preprint arXiv:2605.20211},
  year   = {2026}
}