中文

FastPerson:通过保留语言和视觉语境的有效视频总结提升视频学习效率

计算机视觉与模式识别 2024-03-27 v1 计算与语言 人机交互 多媒体

摘要

快速理解冗长的讲座视频对于时间有限且对 various topics 感兴趣的学习者至关重要,以提高其学习效率。为此,视频总结研究活跃进行中,以便用户仅观看视频中重要场景。然而,这些研究要么关注视频的视觉信息,要么关注音频信息,提取视频中的重要片段。因此,当教师的讲话与黑板或幻灯片上的视觉信息同时重要时(例如在讲座视频中),就会存在遗漏重要信息的风险。为解决此问题,我们提出了 FastPerson,一种考虑讲座视频中视觉和听觉信息的视频总结方法。FastPerson 通过利用音频转录以及屏幕上的图像和文本创建总结视频,最大限地降低了学习者遗漏关键信息的风险。此外,它提供了一个功能,允许学习者在视频的每个章节之间切换总结视频和原始视频,从而根据其兴趣和理解水平调整学习进度。我们对该方法进行了 40 名参与者的评估,确认在使用传统视频播放方法时,相同的理解水平下,缩短了 53% 的观看时间。

关键词

引用

@article{arxiv.2403.17727,
  title  = {FastPerson: Enhancing Video Learning through Effective Video Summarization that Preserves Linguistic and Visual Contexts},
  author = {Kazuki Kawamura and Jun Rekimoto},
  journal= {arXiv preprint arXiv:2403.17727},
  year   = {2024}
}