中文

我们何时不需要更大的视觉模型?

计算机视觉与模式识别 2024-07-19 v2

摘要

扩大视觉模型的规模已是获取更强视觉表示的事实标准。在本工作中,我们讨论了超过何种规模后更大的视觉模型就不再必要。首先,我们展示了规模即规模(S2^2)的强大之处,即经过预训练且冻结的较小视觉模型(例如ViT-B或ViT-L),在多个图像尺度上运行,可超过更大模型(例如ViT-H或ViT-G)在分类、分割、深度估计、多模态LLM(MLLM)基准和机器人操作中的性能。值得注意的是,S2^2在MLLM详细理解V*基准上实现了最先进的性能,超越了GPT-4V等模型。我们检查了S2^2在模型规模方面优于规模化的条件。虽然更大模型在困难样本上具有更好的泛化优势,但我们显示,更大视觉模型的特征可以很好地近似于多尺度较小模型的特征。这表明当前大型预训练模型所学习的大多数,甚至所有表示也可从多尺度较小模型中获得。我们的结果显示,多尺度较小模型的学习容量相当于大型模型,预训练较小模型以S2^2可匹配甚至超过大型模型的优势。我们发布了一个Python软件包,可以一行代码将S2^2应用于任何视觉模型:https://github.com/bfshi/scaling_on_scales。

关键词

引用

@article{arxiv.2403.13043,
  title  = {When Do We Not Need Larger Vision Models?},
  author = {Baifeng Shi and Ziyang Wu and Maolin Mao and Xin Wang and Trevor Darrell},
  journal= {arXiv preprint arXiv:2403.13043},
  year   = {2024}
}

备注

Code: https://github.com/bfshi/scaling_on_scales