LARV:数据无关的层级自适应缩放模型合并方法
计算机视觉与模式识别
2026-02-11 v1 人工智能
机器学习
摘要
模型合并旨在将多个微调模型合并为单个多任务模型,同时无需访问训练数据。现有的任务向量合并方法如 TIES、TSV-M 和 Iso-C/CTS 在聚合规则上存在差异,但均对所有层几乎统一地进行处理。这种假设忽略了大型视觉变换器中各层强烈异质性的事实,其中浅层对干扰敏感,而深层编码稳定的任务特定特征。我们引入 LARV,一种训练无关、数据无关、兼容任意任务向量合并器的层级自适应缩放“面罩”,其可插入任何任务向量合并器中,为每个任务向量的每一层分配一个比例缩放系数,并证明其一致提升了多样化的合并规则。LARV 通过简单确定性计划自适应抑制浅层干扰并放大深层对齐,使用无需重新训练或修改现有合并器的方案。据我们了解,这是首次针对任务向量合并执行层感知缩放。LARV 计算简单的数据无关层代理,并通过轻量级规则将其转化为缩放系数;我们在一个框架内研究了几种实现方式(例如,带有固定值的分层两/三级缩放,或连续映射),并发现分层选择在鲁棒性方面表现最佳,而连续映射则作为消除实验。LARV 与基础合并器是正交的,且开销可忽略。在 FusionBench 上的视觉变换器上,LARV 在 8/14/20 任务设置下一致性改进所有任务向量基线;例如,Iso-C + LARV 在 ViT-B/32 上达到 85.9%,在 ViT-B/16 上达到 89.2%,在 ViT-L/14 上达到 92.6%。层次分析和损坏测试进一步表明,LARV 抑制浅层干扰,同时适度放大深层稳定的任务特征,将模型合并从均匀过程转变为稳健、层感知的过程。
引用
@article{arxiv.2602.09413,
title = {LARV: Data-Free Layer-wise Adaptive Rescaling Veneer for Model Merging},
author = {Xinyu Wang and Ke Deng and Fei Dou and Jinbo Bi and Jin Lu},
journal= {arXiv preprint arXiv:2602.09413},
year = {2026}
}
备注
14 pages, 9 figures, 6 tables