中文

20/20视觉语言模型:仅通过数据筛选构建更优VLM的处方

机器学习 2026-05-14 v2

摘要

数据筛选已经改变了语言模型和对比式图像-文本预训练的质量-计算前沿,但其在视觉语言模型(VLM)中的作用远未确立。我们探究在固定架构、训练方法和计算量,仅改变训练数据的情况下,仅凭数据筛选能将VLM性能提升到何种程度。我们的数据筛选流程应用于MAmmoTH-VL单图像子集,在20个公开VLM基准测试(涵盖定位、视觉问答、OCR/文档、图像描述、空间/3D、计数、图表、数学、品牌识别和多图像推理)上平均提升+11.7个百分点,并在我们高保真VLM评估套件DatBench的全部九个能力轴上平均提升+11.3个百分点。在2B规模下,我们筛选后的模型以约17分之一的训练计算量超越InternVL3.5-2B达9.9个百分点,并以约87分之一的训练计算量将差距缩小至Qwen3-VL-2B的1.8个百分点以内,这仅通过预训练实现。除准确率外,数据筛选还带来四个额外特性:(1)可靠性:不同训练种子下各能力标准差下降约67%,且提升在4k到16k上下文长度扫描中保持稳定;(2)分布外泛化:9项评估的分布外平均得分提升+7.2个百分点,尽管仅在单图像上训练,多图像BLINK得分仍提升+3.09个百分点,其中视觉对应能力提升+11.8个百分点;(3)超越基准的行为增益:在约1100个开放式查询中,筛选后的2B模型比同等计算量的基线模型更诚实、更具体,且比前沿2B参考模型更简洁、更不易拒绝回答;(4)推理成本的帕累托占优:在每个规模(1B、2B、4B)下,筛选后的模型在提升准确率的同时,相比同等计算量的基线模型降低了响应浮点运算量,且筛选后的4B模型以比Qwen3-VL-4B低3.3倍的响应浮点运算量达到了接近前沿的准确率。数据筛选是构建更优VLM的高杠杆工具,能以高达约150分之一的训练计算量达到接近前沿的准确率。

关键词

引用

@article{arxiv.2605.11405,
  title  = {20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone},
  author = {DatologyAI and : and Siddharth Joshi and Haoli Yin and Rishabh Adiga and Haakon Mongstad and Alvin Deng and Aldo Carranza and Alex Fang and Amro Abbas and Anshuman Suri and Brett Larsen and Daniel Zayas and Darren Teh and David Schwab and Diego Kiner and Fan Pan and Jack Urbanek and Jason Lee and Jason Telanoff and Josh Wills and Kaleigh Mentzer and Luke Merrick and Maximilian Böther and Parth Doshi and Paul Burstein and Pratyush Maini and Ties Robroek and Tony Jiang and Vidhi Jain and Vineeth Dorna and Zhengping Wang and Bogdan Gaza and Ari Morcos and Matthew Leavitt},
  journal= {arXiv preprint arXiv:2605.11405},
  year   = {2026}
}

备注

33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/