NanoVLMs:模型能做得多小且仍可构建连贯的视觉语言模型?
计算机视觉与模式识别
2025-02-19 v2 人工智能
摘要
视觉语言模型(Vision-Language Models, VLMs),如 GPT-4V 和 Llama 3.2 vision,因能够在大语言模型(LLMs)的多模态任务中发挥作用而引起了广泛的研究关注。然而,其潜力受到固有挑战的制约,包括专有性限制、巨大的计算需求以及有限的可用性。较小的模型,如 GIT 和 BLIP,表现出明显的局限性,即使经过大量训练,也往往无法生成超过几个 token 的连贯且一致的文本。这引出了一个关键问题:VLM 可以小到什么程度,仍能生成流畅且一致的文本?受 3-4 岁儿童依赖视觉线索进行理解和交流的卓越学习过程的启发,我们引入了两个新颖的数据集:ShortDesc(包含简洁的图像描述)和 LongDesc(包含更详细的图像描述)。这些数据集由图像-文本对组成,其中的文本被限制为幼儿通常使用的简单词汇和语法,并由缩小规模的模型 GPT-4o 生成。使用这些数据集,我们证明了可以训练出比 SOTA 小型 VLM 小最多 10 倍的 VLM,同时保持架构的简单性。为了评估输出,我们利用 GPT-4o 对文本进行评分,就像给学生写的故事打分一样,从创造力、意义性和一致性三个维度进行评估,给出满分 10 分的分数。该方法通过适应非结构化输出并提供对模型能力的多维度评估,弥补了标准基准测试的局限性。我们的发现有助于为资源受限环境开发轻量级、可访问的多模态模型。
引用
@article{arxiv.2502.07838,
title = {NanoVLMs: How small can we go and still make coherent Vision Language Models?},
author = {Mukund Agarwalla and Himanshu Kumar and Raj Dandekar and Rajat Dandekar and Sreedath Panat},
journal= {arXiv preprint arXiv:2502.07838},
year = {2025}
}
备注
11 pages, 8 figures, 3 tables