中文

重访基础模型时代的模型拼接

计算机视觉与模式识别 2026-03-17 v2 人工智能 机器学习

摘要

模型拼接通过将一个模型(源模型)的早期层连接到另一个模型(目标模型)的后期层,间接通过一个轻量级拼接层实现,曾作为表征兼容性的探针。先前的研究发现,尽管不同初始化或目标函数,训练于相同数据集的模型仍可拼接(精度几乎不变)。我们在视觉基础模型(VFM)上重审拼接问题,这些模型在目标函数、数据和模态混合方面各不相同(例如 CLIP、DINOv2、SigLIP 2),并提出问题:异构 VFM 是否可拼接?我们引入一个系统化的协议,涵盖拼接点、拼接层族、训练损失以及下游任务。三个发现浮现:(1)拼接层训练至关重要:传统方法在拼接点匹配中间特征或端到端优化任务损失时,难以保持精度,尤其在浅层拼接点。(2)在目标模型 penultimate 层采用简单的特征匹配损失,异构 VFM 在视觉任务中可靠可拼接。(3)对于深层拼接点,拼接后模型仅需少量推理开销(拼接层开销)即可超越其中任何一个组成模型。基于这些发现,我们进一步提出 VFM Stitch Tree(VST),在保留 VFM 后期层的同时共享其早期层,为多模态大语言模型提供可控的精度-延迟权衡,因为多模态 LLM 常依赖多个 VFM。总体而言,本研究将拼接从诊断性探针提升为整合不同 VFM 优势、把握其表征对齐或发散处的实用配方。

关键词

引用

@article{arxiv.2603.12433,
  title  = {Revisiting Model Stitching In the Foundation Model Era},
  author = {Zheda Mai and Ke Zhang and Fu-En Wang and Zixiao Ken Wang and Albert Y. C. Chen and Lu Xia and Min Sun and Wei-Lun Chao and Cheng-Hao Kuo},
  journal= {arXiv preprint arXiv:2603.12433},
  year   = {2026}
}

备注

Accepted by CVPR 2026