中文

教育视频中的显著性检测:分析当前模型性能、识别局限性与改进方向

计算机视觉与模式识别 2024-08-09 v1

摘要

识别学习者对学习资源中哪些区域给予关注,对于评估该材料的影响以及改进其设计和相关支持系统至关重要。视频中的显著性检测旨在自动识别单帧图像中吸引注意力的区域。在教育环境中,识别视频视觉流中的相关区域可以增强内容的可访问性以及视频分割、导航和摘要等信息检索任务。这些进步可以为开发更高效支持学习的先进人工智能辅助技术铺平道路。然而,由于教育视频结合了文本、语音、插图、动画等独特特征,这项任务变得尤为具有挑战性。据我们所知,目前尚无研究评估教育视频中的显著性检测方法。在本文中,我们通过评估四种用于教育视频的最先进显著性检测方法来填补这一空白。我们复现了原始研究,并探索了在通用(非教育)数据集上的复现能力。然后,我们研究了这些模型的泛化能力,并评估它们在教育视频上的性能。我们进行了全面分析,以识别常见的失败场景和可能的改进领域。我们的实验结果表明,对于通用的视频显著性检测模型而言,教育视频仍然是一个具有挑战性的场景。

关键词

引用

@article{arxiv.2408.04515,
  title  = {Saliency Detection in Educational Videos: Analyzing the Performance of Current Models, Identifying Limitations and Advancement Directions},
  author = {Evelyn Navarrete and Ralph Ewerth and Anett Hoppe},
  journal= {arXiv preprint arXiv:2408.04515},
  year   = {2024}
}