中文

视觉Transformer模型库

机器学习 2025-04-15 v1

摘要

大型结构化神经网络群体——称为“模型库”——的可用性,导致了从模型分析、到在模型权重上的表示学习,以及对神经网络参数的生成式建模等多种下游任务的发展。然而,现有的模型库在规模和架构方面有限,忽视了Transformer——这是目前最成功的神经网络架构之一。我们通过引入首个视觉Transformer(ViT)模型库来弥补这一差距。为更好地代表近期的训练方法,我们开发了一种新的模型库生成蓝图,涵盖预训练和微调步骤,并发布了250个独特模型。它们在广泛的生成因素上仔细生成,其多样性通过彻底选择的权重空间和行为指标得到验证。为进一步激励我们提议的数据实用性,我们建议多个可能的应用,基于广泛的探索性实验和来自现有文献的多个示例。通过扩展类似的先前工作,我们的模型库允许研究人员将其模型聚类方法从小模型范例推进到最先进的架构。我们在github.com/ModelZoos/ViTModelZoo上提供该模型库。

关键词

引用

@article{arxiv.2504.10231,
  title  = {A Model Zoo of Vision Transformers},
  author = {Damian Falk and Léo Meynent and Florence Pfammatter and Konstantin Schürholt and Damian Borth},
  journal= {arXiv preprint arXiv:2504.10231},
  year   = {2025}
}

备注

Accepted at the ICLR Workshop on Neural Network Weights as a New Data Modality 2025