中文

讲座视频视觉对象(LVVO)数据集:教育视频中视觉目标检测的基准测试

计算机视觉与模式识别 2025-06-18 v2 机器学习

摘要

我们提出讲座视频视觉对象(LVVO)数据集,这是一个用于教育视频内容中视觉目标检测的新基准。该数据集包含从245个讲座视频中提取的4000帧,涵盖生物学、计算机科学和地球科学。其中1000帧(称为LVVO_1k)已使用边界框对四个视觉类别进行人工标注:表格(Table)、图表(Chart-Graph)、摄影图像(Photographic-image)和视觉插图(Visual-illustration)。每帧由两名标注者独立标注,得到标注者间F1分数为83.41%,表明具有较强的一致性。为确保高质量的共识标注,一名第三位专家通过冲突解决流程审查并解决了所有不一致的情况。为扩展数据集,采用半监督方法自动标注其余3000帧,构成LVVO_3k。该完整数据集为开发和评估教育视频中视觉内容检测的有监督和半监督方法提供了宝贵资源。LVVO数据集公开发布,以支持该领域的进一步研究。

关键词

引用

@article{arxiv.2506.13657,
  title  = {Lecture Video Visual Objects (LVVO) Dataset: A Benchmark for Visual Object Detection in Educational Videos},
  author = {Dipayan Biswas and Shishir Shah and Jaspal Subhlok},
  journal= {arXiv preprint arXiv:2506.13657},
  year   = {2025}
}