中文

基于树状专家的模型权重学习

机器学习 2025-06-04 v3 计算机视觉与模式识别

摘要

公开可获取的模型数量正在迅速增长,但大多数模型缺乏文档。寻求适用于自身任务的模型的用户必须首先确定每个模型的功能。训练机器学习模型从模型权重推断缺失文档具有挑战性,因为这些权重常包含与模型功能无关的显著变异(称为干扰)。我们识别了真实世界模型的一个关键特性:大多数公开模型属于小组 Model Trees,其中树中所有模型都源自一个共同的祖先(例如,基础模型)。重要的是,我们发现在每个树内部,模型之间存在较少的干扰变异。具体而言,尽管在 Model Trees 之间学习需要复杂的架构,即使在单个模型层上训练的线性分类器在树内部也常常有效。虽然有效,但这些线性分类器在处理具有大量参数的大型模型时计算成本高昂。为解决此问题,我们引入了 Probing Experts (ProbeX),一种在理论上得到动机且轻量级的方法。值得注意的是,ProbeX 是首个专为学习单个隐藏模型层权重而设计的探针方法。我们通过仅基于其权重预测模型训练数据集中的类别来展示 ProbeX 的有效性。令人兴奋的是,ProbeX 可以将 Stable Diffusion 的权重映射到权重语言嵌入空间中,实现通过文本进行模型搜索,即零-shot 模型分类。

关键词

引用

@article{arxiv.2410.13569,
  title  = {Learning on Model Weights using Tree Experts},
  author = {Eliahu Horwitz and Bar Cavia and Jonathan Kahana and Yedid Hoshen},
  journal= {arXiv preprint arXiv:2410.13569},
  year   = {2025}
}

备注

CVPR 2025. Project page: https://horwitz.ai/probex/