中文

从带同步高亮的幻灯片生成讲座视频

计算机视觉与模式识别 2025-05-07 v1 人工智能

摘要

将静态幻灯片转化为引人入胜的视频讲座需要大量时间和精力,需要演示者记录解释并引导观众通过材料。我们引入了一个端到端系统,旨在完全自动化这一过程。给定一个幻灯片组,该系统综合了具有AI生成语音的视频讲座,语音与动态视觉高亮同步。这些高亮自动地引导对特定概念的关注,就像一个有效的演示者一样。核心技术贡献是一种 novel 的高亮对齐模块。该模块使用多种策略(例如Levenshtein距离、LLM 基于语义分析)将 spoken 短语映射到给定幻灯片上的位置,可在不同粒度(行或单词级别)下选择,并利用提供时间戳的文本转语音(TTS)进行时间同步。我们通过使用包含1000个样本的手动标注幻灯片数据集进行技术评估,发现LLM 基于对齐在位置准确性方面 achieves high accuracy (F1 > 92%),显著优于简单方法,尤其是在复杂数学密集型内容方面。此外,计算的生成成本平均不到每小时视频的1美元,为手动生产成本的保守估计节省约两个数量级。该方法在高准确性和极低成本之间的结合,将其定位为一种实用且可扩展的工具,用于将静态幻灯片转化为有效的、视觉引导的视频讲座。

关键词

引用

@article{arxiv.2505.02966,
  title  = {Generating Narrated Lecture Videos from Slides with Synchronized Highlights},
  author = {Alexander Holmberg},
  journal= {arXiv preprint arXiv:2505.02966},
  year   = {2025}
}