Molmo和PixMo:用于最先进视觉-语言模型的开源权重和开放数据
计算机视觉与模式识别
2024-12-06 v2 计算与语言
机器学习
摘要
当今最先进的视觉-语言模型(VLM)仍然是专有的。最强的开源权重模型严重依赖来自专有VLM的合成数据来获得良好性能,实际上是将这些封闭的VLM蒸馏到开放模型中。因此,社区一直缺乏关于如何从头构建高性能VLM的基础知识。我们提出了Molmo,一个新的VLM家族,在其开放性类别中处于最先进水平。我们的关键贡献是一组名为PixMo的新数据集,包括用于预训练的高细节图像标题数据集、用于微调的自由形式图像问答数据集,以及一个创新的2D指向数据集,所有这些都是在不使用外部VLM的情况下收集的。我们方法的成功依赖于仔细的建模选择、精心调整的训练流程,以及最关键的是,我们新收集数据集的质量。我们同类最佳的72B模型不仅在开源权重和数据模型类别中优于其他模型,而且还优于更大的专有模型,包括Claude 3.5 Sonnet、Gemini 1.5 Pro和Flash,在学术基准和大型人工评估中仅次于GPT-4o。我们的模型权重、新数据集和源代码可在 https://molmo.allenai.org/blog 获取。
引用
@article{arxiv.2409.17146,
title = {Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models},
author = {Matt Deitke and Christopher Clark and Sangho Lee and Rohun Tripathi and Yue Yang and Jae Sung Park and Mohammadreza Salehi and Niklas Muennighoff and Kyle Lo and Luca Soldaini and Jiasen Lu and Taira Anderson and Erin Bransom and Kiana Ehsani and Huong Ngo and YenSung Chen and Ajay Patel and Mark Yatskar and Chris Callison-Burch and Andrew Head and Rose Hendrix and Favyen Bastani and Eli VanderBilt and Nathan Lambert and Yvonne Chou and Arnavi Chheda and Jenna Sparks and Sam Skjonsberg and Michael Schmitz and Aaron Sarnat and Byron Bischoff and Pete Walsh and Chris Newell and Piper Wolters and Tanmay Gupta and Kuo-Hao Zeng and Jon Borchardt and Dirk Groeneveld and Crystal Nam and Sophie Lebrecht and Caitlin Wittlif and Carissa Schoenick and Oscar Michel and Ranjay Krishna and Luca Weihs and Noah A. Smith and Hannaneh Hajishirzi and Ross Girshick and Ali Farhadi and Aniruddha Kembhavi},
journal= {arXiv preprint arXiv:2409.17146},
year = {2024}
}
备注
Updated with ablations and more technical details