让 ViT 说话:生成式语言-图像预训练
计算机视觉与模式识别
2026-05-04 v1
摘要
本文提出了一种名为 GenLIP (Generative Language-Image Pre-training) 的极简式生成式预训练框架,专为视觉 Transformer (ViT) 设计,旨用于多模态大语言模型 (MLLM)。为更好地将视觉编码器与 LLM 的自回归性质相匹配,GenLIP 训练一个 ViT 直接从视觉标记预测语言标记,采用标准的语言建模目标,无需对比性批处理构建或额外的文本解码器。这种设计具有三个关键优势:(1) 简单性:单个 Transformer 同时建模视觉和文本标记;(2) 可扩展性:它能够有效地随数据规模和模型规模进行扩展;(3) 性能:它在多样化的多模态基准测试中实现了竞争甚至优于强大的基线方法。在 80 亿来自 Recap-DataComp-1B 的样本上训练后,GenLIP 虽然使用了远少于预训练数据,却达到了或超越了强大的基线方法。在保持多分辨率图像的原始宽高比进行继续预训练后,GenLIP 在 OCR 和图表理解等细节敏感任务上进一步提升,成为 MLLM 中视觉编码器的强大基础。
引用
@article{arxiv.2605.00809,
title = {Let ViT Speak: Generative Language-Image Pre-training},
author = {Yan Fang and Mengcheng Lan and Zilong Huang and Weixian Lei and Yunqing Zhao and Yujie Zhong and Yingchen Yu and Qi She and Yao Zhao and Yunchao Wei},
journal= {arXiv preprint arXiv:2605.00809},
year = {2026}
}
备注
24 pages, 9 figures