中文

ViBED-Net: 利用面部感知和场景感知时空线索的视频参与度检测网络

计算机视觉与模式识别 2025-10-28 v2 机器学习

摘要

在线学习环境中的参与度检测对于改善学生成绩和个性化教学至关重要。我们提出了ViBED-Net(基于视频的参与度检测网络),这是一种新颖的深度学习框架,旨在通过双流架构从视频数据中评估学生的参与度。ViBED-Net通过EfficientNetV2处理面部裁剪区域和完整视频帧以提取空间特征,从而同时捕捉面部表情和完整场景上下文。随后,这些特征通过两种时序建模策略(长短期记忆网络和Transformer编码器)进行时序分析。我们的模型在DAiSEE数据集(一个用于电子学习情感状态识别的大规模基准)上进行了评估。为了提升在代表性不足的参与度类别上的性能,我们应用了针对性的数据增强技术。在测试的变体中,采用LSTM的ViBED-Net达到了73.43%的准确率,优于现有的最先进方法。ViBED-Net证明了结合面部感知和场景感知的时空线索能显著提高参与度检测的准确性。其模块化设计使其能够灵活应用于教育、用户体验研究和内容个性化等领域。这项工作通过提供一个可扩展、高性能的解决方案,推进了基于视频的情感计算在真实世界参与度分析中的应用。本项目源代码可在 https://github.com/prateek-gothwal/ViBED-Net 获取。

关键词

引用

@article{arxiv.2510.18016,
  title  = {ViBED-Net: Video Based Engagement Detection Network Using Face-Aware and Scene-Aware Spatiotemporal Cues},
  author = {Prateek Gothwal and Deeptimaan Banerjee and Ashis Kumer Biswas},
  journal= {arXiv preprint arXiv:2510.18016},
  year   = {2025}
}

备注

10 pages, 4 figures, 2 tables