我们何时不需要更大的视觉模型?
计算机视觉与模式识别
2024-07-19 v2
摘要
扩大视觉模型的规模已是获取更强视觉表示的事实标准。在本工作中,我们讨论了超过何种规模后更大的视觉模型就不再必要。首先,我们展示了规模即规模(S)的强大之处,即经过预训练且冻结的较小视觉模型(例如ViT-B或ViT-L),在多个图像尺度上运行,可超过更大模型(例如ViT-H或ViT-G)在分类、分割、深度估计、多模态LLM(MLLM)基准和机器人操作中的性能。值得注意的是,S在MLLM详细理解V*基准上实现了最先进的性能,超越了GPT-4V等模型。我们检查了S在模型规模方面优于规模化的条件。虽然更大模型在困难样本上具有更好的泛化优势,但我们显示,更大视觉模型的特征可以很好地近似于多尺度较小模型的特征。这表明当前大型预训练模型所学习的大多数,甚至所有表示也可从多尺度较小模型中获得。我们的结果显示,多尺度较小模型的学习容量相当于大型模型,预训练较小模型以S可匹配甚至超过大型模型的优势。我们发布了一个Python软件包,可以一行代码将S应用于任何视觉模型:https://github.com/bfshi/scaling_on_scales。
引用
@article{arxiv.2403.13043,
title = {When Do We Not Need Larger Vision Models?},
author = {Baifeng Shi and Ziyang Wu and Maolin Mao and Xin Wang and Trevor Darrell},
journal= {arXiv preprint arXiv:2403.13043},
year = {2024}
}
备注
Code: https://github.com/bfshi/scaling_on_scales