FeatCal:后合并模型的特征校准
机器学习
2026-05-14 v1 人工智能
摘要
模型合并将任务专家合并为单个模型,避免进行联合训练、重新训练或部署多个专家模型,但合并后的模型通常仍低于专家性能。我们通过特征漂移——即合并后模型与专家在相同输入上产生的特征差异——来研究这种性能差距。我们的理论将这种漂移分解为上游传播和局部不匹配,跟踪其如何通过前向顺序中的后续层进行传播和组合,并将最终特征漂移关联到输出漂移。这种视角激发了FeatCal,该方法利用小型校准集逐层校准合并后模型的权重(按前向顺序),在保持接近合并后权重并保留模型合并优势的同时减少特征漂移。FeatCal使用高效闭式解来更新模型权重,不需要梯度下降、迭代优化或额外模块。在主要的CLIP和GLUE基准测试中,FeatCal在CLIP-ViT-B/32任务算术(Task Arithmetic, TA)上击败Surgery和ProbSurgery,最接近的后合并校准基线方法:85.5% vs. 77.0%/78.8%;在FLAN-T5-base GLUE上为85.2% vs. 83.7%/82.2%。在CLIP-ViT-B/32上,仅需8个每个任务的示例即可达到82.9%,而256个每个任务的示例仅需53秒,约为两个基线方法的4倍,显示出更好的样本效率和更低的校准成本。
引用
@article{arxiv.2605.13030,
title = {FeatCal: Feature Calibration for Post-Merging Models},
author = {Yanggan Gu and Shuo Cai and Zihao Wang and Wenjun Wang and Yuanyi Wang and Pengkai Wang and Sirui Huang and Su Lu and Jianmin Wu and Hongxia Yang},
journal= {arXiv preprint arXiv:2605.13030},
year = {2026}
}