StatsMerging:基于任务特定教师蒸馏的统计导向模型合并
机器学习
2025-06-06 v1 计算机视觉与模式识别
摘要
模型合并已涌现为在受限内存预算内容纳多个大型模型的有前景解决方案。我们提出了 StatsMerging,这是一种新型轻量级基于统计的模型合并方法,无需 ground truth 标签或测试样本。StatsMerging 提供三个关键优势:(1)它独特地利用奇异值分解(SVD)中的奇异值来捕获任务特定的权重分布,作为任务重要性的代理,以指导任务系数预测;(2)它采用轻量级学习器 StatsMergeLearner 来建模任务特定预训练模型的权力分布,提高了泛化性并增强了对未见样本的适应性;(3)它引入了任务特定教师蒸馏,用于合并具有异构架构的视觉模型,一种避免高成本 ground-truth 标签的合并学习范式。值得注意的是,我们提出了两种类型的知识蒸馏:(a)从任务特定模型蒸馏知识到 StatsMergeLearner;(b)在合并前从具有异构架构的模型蒸馏知识。广泛的实验在八个任务上证明了 StatsMerging 的有效性。我们的结果表明,StatsMerging 在整体准确率、对未见任务的泛化以及对图像质量变化的鲁棒性方面均优于最先进的技术。
引用
@article{arxiv.2506.04567,
title = {StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation},
author = {Ranjith Merugu and Bryan Bo Cao and Shubham Jain},
journal= {arXiv preprint arXiv:2506.04567},
year = {2025}
}
备注
14 pages, 4 figures, 7 tables