中文

VisualWebInstruct:通过Web搜索扩展多模态指令数据

计算机视觉与模式识别 2025-03-18 v2 人工智能 计算与语言

摘要

视觉-语言模型在许多以感知为中心的任务上取得了显着进展。然而,由于缺乏高质量且多样化的训练数据,其在以推理为中心的任务上的进展仍有限。本文旨在解决推理导向多模态数据集的稀缺问题。我们提出VisualWebInstruct,一种利用搜索引擎创建多样化高质量数据集的方法,涵盖数学、物理、金融、化学等多个学科。我们从精心挑选的30,000个种子图像开始,使用Google Image Search识别包含相似图像的网站。我们收集并处理超过70万个唯一URL的HTML数据。通过内容提取、筛选和综合管道,我们构建了一个约90万个问答(QA)对的数据集,其中40%为视觉QA对,剩余为文本QA对。在VisualWebInstruct上微调的模型在基准测试中表现显著提升:(1)在Llava-OV上微调可实现基准测试中10-20分的绝对提升,(2)从MAmmoTH-VL微调可实现基准测试中5分的提升。我们最好的模型MAmmoTH-VL2 在MMM-U-Pro(40.7)、MathVerse(42.6)和DynaMath(55.7)中在10B参数规模内实现最先进性能。这一结果凸显了我们数据集在提升视觉-语言模型处理复杂多模态任务推理能力方面的有效性。

关键词

引用

@article{arxiv.2503.10582,
  title  = {VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search},
  author = {Yiming Jia and Jiachen Li and Xiang Yue and Bo Li and Ping Nie and Kai Zou and Wenhu Chen},
  journal= {arXiv preprint arXiv:2503.10582},
  year   = {2025}
}

备注

Technical Report