从注视到洞察:一种用于检测面对面协作学习中注视行为的可扩展 AI 方法
计算机视觉与模式识别
2026-04-10 v2
摘要
先前的研究已表明,分析协作学习中的注视行为有潜力为学生反思其学习提供具有教育意义的信息。在过去的几十年中,机器学习方法已被开发出来,用于从视频数据中自动检测注视行为。然而,由于这些方法通常需要大量标记数据进行训练,人工标注仍然必不可少。此外,研究人员对已开发的机器学习模型的跨配置鲁棒性提出了质疑,因为训练数据集往往无法涵盖教育环境中遇到的全部情况。为应对这些挑战,本研究提出了一种可扩展的人工智能方法,该方法利用预训练模型和基础模型,在无需人工标注数据的情况下,自动检测面对面协作学习环境中的注视行为。该方法利用预训练的 YOLO11 进行人员跟踪,利用具有文本提示能力的 YOLOE-26 进行教育相关物体检测,并利用 Gaze-LLE 模型进行注视目标预测。结果表明,所提方法在从视频数据中检测学生注视行为方面达到了 0.829 的 F1 分数,对笔记本电脑注视和同伴注视表现出较强的性能,但对其他注视目标的性能较弱。此外,与其他监督机器学习方法相比,所提方法在复杂环境中表现出更优越、更稳定的性能,突显了其更好的跨配置鲁棒性。本文还讨论了该方法对支持学生在真实世界环境中进行协作学习的意义。
引用
@article{arxiv.2604.03317,
title = {Gaze to Insight: A Scalable AI Approach for Detecting Gaze Behaviours in Face-to-Face Collaborative Learning},
author = {Junyuan Liang and Qi Zhou and Sahan Bulathwela and Mutlu Cukurova},
journal= {arXiv preprint arXiv:2604.03317},
year = {2026}
}
备注
15 pages, 6 figures, 2 tables, accepted by the 27th International Conference on Artificial Intelligence in Education (AIED 2026)