中文

EgoInstruct:一个自我中心视频数据集,记录面对面教学交互及多模态LLM基准测试

计算机视觉与模式识别 2025-09-29 v1

摘要

分析在同一物理空间中共同在场的教师与学习者之间的教学交互,是教育支持和技能迁移的关键问题。然而,此类面对面的教学场景尚未在计算机视觉中被系统研究。我们确定了两个关键原因:i)缺乏合适的数据集和ii)分析技术有限。为填补这一空白,我们呈现了一个新的自我中心视频数据集,记录面对面教学,并为两个基本任务提供真实标注,作为全面理解教学交互的第一步:程序步骤分割和对话状态分类。利用该数据集,我们将多模态大语言模型(MLLMs)与传统任务特定模型进行基准对比。由于面对面教学涉及多种模态(语音内容和韵律、注视和身体运动,以及视觉上下文),有效理解需要能够以集成方式处理语言和非语言交流的方法。因此,我们评估了最近引入的MLLMs,它们联合处理图像、音频和文本。此评估量化了当前机器学习模型对面面对教学场景的理解程度。在实验中,MLLMs即使没有任务特定微调也优于专门基线,表明它们在全面理解教学交互方面的潜力。

关键词

引用

@article{arxiv.2509.22019,
  title  = {EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking},
  author = {Yuki Sakai and Ryosuke Furuta and Juichun Yen and Yoichi Sato},
  journal= {arXiv preprint arXiv:2509.22019},
  year   = {2025}
}

备注

Accepted to the I-HFM Workshop at ICCV 2025