中文

基于 VLM 驱动结构化绘图表示的语音同步白板生成

计算机视觉与模式识别 2026-03-30 v1 机器学习

摘要

创建白板风格教育视频需要在自由手绘插图与口头叙述之间进行精确协调,但现有方法均未通过结构化、可复现的绘图表示来解决这一多模态同步问题。我们提供了首个包含 24 对 Excalidraw 演示与配音音频的数据集,其中每个绘图元素均带有毫秒级精度的创建时间戳,涵盖 8 个 STEM 领域。利用这些数据,我们研究了通过 LoRA 微调的视觉语言模型(Qwen2-VL-7B)是否仅从 24 个演示中就能预测与语音同步的完整笔画序列。我们的主题分层五折评估表明,时间戳条件化显著改善了与消融基线的时间对齐,而模型在未见过的 STEM 主题上具有泛化能力。我们讨论了向真实课堂环境的可迁移性,并发布了数据集和代码,以支持自动化教育内容生成领域的未来研究。

关键词

引用

@article{arxiv.2603.25870,
  title  = {Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations},
  author = {Suraj Prasad and Pinak Mahapatra},
  journal= {arXiv preprint arXiv:2603.25870},
  year   = {2026}
}