从带同步高亮的幻灯片生成讲座视频
计算机视觉与模式识别
2025-05-07 v1 人工智能
摘要
将静态幻灯片转化为引人入胜的视频讲座需要大量时间和精力,需要演示者记录解释并引导观众通过材料。我们引入了一个端到端系统,旨在完全自动化这一过程。给定一个幻灯片组,该系统综合了具有AI生成语音的视频讲座,语音与动态视觉高亮同步。这些高亮自动地引导对特定概念的关注,就像一个有效的演示者一样。核心技术贡献是一种 novel 的高亮对齐模块。该模块使用多种策略(例如Levenshtein距离、LLM 基于语义分析)将 spoken 短语映射到给定幻灯片上的位置,可在不同粒度(行或单词级别)下选择,并利用提供时间戳的文本转语音(TTS)进行时间同步。我们通过使用包含1000个样本的手动标注幻灯片数据集进行技术评估,发现LLM 基于对齐在位置准确性方面 achieves high accuracy (F1 > 92%),显著优于简单方法,尤其是在复杂数学密集型内容方面。此外,计算的生成成本平均不到每小时视频的1美元,为手动生产成本的保守估计节省约两个数量级。该方法在高准确性和极低成本之间的结合,将其定位为一种实用且可扩展的工具,用于将静态幻灯片转化为有效的、视觉引导的视频讲座。
引用
@article{arxiv.2505.02966,
title = {Generating Narrated Lecture Videos from Slides with Synchronized Highlights},
author = {Alexander Holmberg},
journal= {arXiv preprint arXiv:2505.02966},
year = {2025}
}