中文

基于迁移学习和数据增强的教育视频视觉内容检测

计算机视觉与模式识别 2025-08-19 v2

摘要

视频正在通过在线课程和录制的讲座来改变教育,这些内容既在补充又在取代传统课堂教学。近期研究聚焦于通过高级导航、可检索性、概要生成以及问答聊天机器人等手段来提升视频讲座的信息检索能力。视觉元素如表格、图表和插图是课堂视频中理解、记忆和数据呈现的核心要素,但其在提高视频内容可访问性方面的潜力仍未得到充分利用。一个主要原因是,准确地自动检测课堂视频中的视觉元素具有挑战性;具体原因包括:i) 大多数视觉元素,如图表、图形、表格和插图,都是人工创建的,缺乏标准结构;ii) 连贯的视觉对象可能缺乏清晰的边界,由连接的文本和视觉组件构成。尽管深度学习基于对象检测的技术取得了进展,但当前模型由于课堂视频视觉内容的独特性以及标注数据集的稀缺,仍未取得令人满意的性能。本文报告了一种用于检测课堂视频帧中视觉元素的迁移学习方法。评估了一套最先进的对象检测模型在课堂视频数据集上的性能。YOLO被证明是该任务中最有前景的模型。随后针对课堂视频对象检测对YOLO进行了优化,通过在多个基准数据集上进行训练并部署半监督自动标注策略。结果评估了这一方法的成功情况,同时开发了一个解决课堂视频中对象检测问题的通用方法。论文的贡献包括公开发布的标注课堂视频帧基准数据集,以及用于促进未来研究的源代码。

关键词

引用

@article{arxiv.2506.21903,
  title  = {Visual Content Detection in Educational Videos with Transfer Learning and Dataset Enrichment},
  author = {Dipayan Biswas and Shishir Shah and Jaspal Subhlok},
  journal= {arXiv preprint arXiv:2506.21903},
  year   = {2025}
}

备注

This is an extended version of a paper accepted to MIPR 2025