通过多教师知识蒸馏实现模型合并
机器学习
2025-12-25 v1 人工智能
摘要
模型合并已成为轻量级替代方案,以取代联合多任务学习(MTL),但合并模型的泛化性能仍 largely 未被探索。建立此类理论保证并不容易,因为合并过程通常不允许访问原始训练数据,并且涉及组合在根本上异构数据分布上训练的精调模型。在没有原则性理解这些动态的前提下,当前方法往往依赖启发式方法来近似最佳参数组合。这种依赖最为关键的是系数缩放,即调节每个精调模型对共享参数贡献大小的权重因子。然而,由于缺乏原则性目标引导其选择,这些方法导致性能脆弱且对缩放初始化高度敏感。为填补这一空白,我们(i)提出一种针对模型合并情境的新型平坦感知 PAC-Bayes 泛化界限。该分析引入一种“跨任务异构性”术语,正式捕捉不同精调模型先验与目标多任务分布之间的不匹配。围绕此理论洞见,(ii)我们将模型合并建模为稀缺无标签数据上的多教师知识蒸馏。我们正式演示,最小化学生-教师 Kullback-Leibler 发散可直接紧密上限合并模型的超风险。围绕推导的平坦感知界限,(iii)我们通过 SAMerging 实现了该目标,该方法采用锐度感知最小化(SAM)寻找平坦最小值。实验表明,SAMerging 在视觉和 NLP 基准上实现了新的 SOTA 水平,取得了显著的性能。代码已公开于 https://github.com/arshandalili/SAMerging。
引用
@article{arxiv.2512.21288,
title = {Model Merging via Multi-Teacher Knowledge Distillation},
author = {Seyed Arshan Dalili and Mehrdad Mahdavi},
journal= {arXiv preprint arXiv:2512.21288},
year = {2025}
}