中文

课堂上的 2.5 年:面向视觉-语言预训练的多模态教科书

计算机视觉与模式识别 2025-05-14 v4 计算与语言 机器学习

摘要

与图像-文本对数据相比,交错语料库使视觉-语言模型(VLM)能够像人类一样更自然地理解世界。然而,此类现有数据集均从网页抓取,面临知识密度低、图文关系松散以及图像间逻辑连贯性差等挑战。另一方面,互联网上拥有大量教学视频(例如在线几何课程),被人类广泛用于学习基础学科,但这些宝贵资源在 VLM 训练中仍未被充分探索。在本文中,我们引入了一个高质量的**多模态教科书**语料库,为 VLM 预训练提供更丰富的基础知识。它收集了超过 2.5 年的教学视频,总计 22,000 个课时。我们首先使用 LLM 提出的分类法系统地收集教学视频。然后,我们逐步从视频中提取并精炼视觉(关键帧)、音频(ASR)和文本知识(OCR),并基于时间顺序组织成图文交错语料库。与同类数据集相比,我们以视频为中心的教科书提供了更连贯的上下文、更丰富的知识以及更好的图文对齐。实验证明了其卓越的预训练性能,特别是在 ScienceQA 和 MathVista 等知识和推理密集型任务中。此外,在我们的教科书上预训练的 VLM 表现出出色的交错上下文感知能力,能够利用其少样本上下文中的视觉和文本线索来解决任务。我们的代码可在 https://github.com/DAMO-NLP-SG/multimodal_textbook 获取。

关键词

引用

@article{arxiv.2501.00958,
  title  = {2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining},
  author = {Wenqi Zhang and Hang Zhang and Xin Li and Jiashuo Sun and Yongliang Shen and Weiming Lu and Deli Zhao and Yueting Zhuang and Lidong Bing},
  journal= {arXiv preprint arXiv:2501.00958},
  year   = {2025}
}

备注

Under review