中文

脚本到幻灯片 grounding:用于自动指令性视频生成的脚本句子 grounding 到幻灯片对象

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

虽然以幻灯片为基础的视频在教育和研究演示中广泛使用,但视频编辑过程——特别是将口头内容应用到幻灯片对象上以添加视觉效果——仍高度依赖人工操作。本研究旨在开发一个从幻灯片和相应脚本自动生成此类教学视频的系统。作为 foundational step,本文提出并定义了脚本到幻灯片 grounding(S2SG),即将脚本句子 grounding 到其对应幻灯片对象的任务。此外,作为初始步骤,我们提出了“Text-S2SG”方法,利用大语言模型(LLM)执行此 grounding 任务。我们的实验表明,所提方法取得了高水平性能(F1-score: 0.924)。本工作的贡献在于将此前隐含的基于幻灯片的视频编辑过程形式化为可计算任务,从而为其自动化铺平了道路。

关键词

引用

@article{arxiv.2603.16931,
  title  = {Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation},
  author = {Rena Suzuki and Masato Kikuchi and Tadachika Ozono},
  journal= {arXiv preprint arXiv:2603.16931},
  year   = {2026}
}

备注

The 21st International Conference on E-Service and Knowledge Management (ESKM 2025-Winter)