VLMs是否应该使用图像数据进行预训练?
计算机视觉与模式识别
2025-03-11 v1
摘要
使用图像数据进一步训练的预训练大语言模型在视觉语言任务上表现良好。虽然在第二个训练阶段添加图像能够有效地解锁这一能力,但究竟是两种训练流程相比,引入视觉标记的增益或损失如何尚未明了。为此,我们训练了各种数据集、规模、图像文本比例以及在引入视觉标记前预训练程度的模型,然后对其进行微调并在 diverse vision-language 和 text-only 任务套件上进行评估。我们发现,预训练时混合图像和文本数据可让模型在视觉语言任务上表现更好,同时保持在 text-only 评估中的强性能力。在6个不同任务的平均值上,我们发现对于10亿参数的模型,在预训练完成后80%过程中引入视觉标记,比将视觉标记引入完全预训练模型时,平均提升2%。
引用
@article{arxiv.2503.07603,
title = {Should VLMs be Pre-trained with Image Data?},
author = {Sedrick Keh and Jean Mercat and Samir Yitzhak Gadre and Kushal Arora and Igor Vasiljevic and Benjamin Burchfiel and Shuran Song and Russ Tedrake and Thomas Kollar and Ludwig Schmidt and Achal Dave},
journal= {arXiv preprint arXiv:2503.07603},
year = {2025}
}
备注
ICLR 2025