ZipIt!:无需训练合并不同任务的模型
计算机视觉与模式识别
2024-03-14 v3 机器学习
摘要
典型的深度视觉识别模型只能执行其训练时所针对的单一任务。在本文中,我们解决了将具有不同初始化、各自解决不同任务的多个独立模型合并为一个多任务模型且无需任何额外训练的极困难问题。已有的模型合并工作将一个模型置换到另一个模型的空间中然后取平均。虽然这适用于在同一任务上训练的模型,但我们发现这未能考虑在互不相交任务上训练模型之间的差异。因此,我们提出了“ZipIt!”,一种合并同架构任意两个模型的通用方法,其包含两种简单策略。首先,为处理模型间不共享的特征,我们将模型合并问题扩展为允许通过定义通用的“zip”操作在每个模型内部合并特征。其次,我们增加对模型部分“zip”直至指定层的支持,自然地形成多头模型。我们发现这两项改变相结合相较已有工作带来20–60%的提升,使得合并互不相交任务上训练的模型而无需重训练更为可行。
引用
@article{arxiv.2305.03053,
title = {ZipIt! Merging Models from Different Tasks without Training},
author = {George Stoica and Daniel Bolya and Jakob Bjorner and Pratik Ramesh and Taylor Hearn and Judy Hoffman},
journal= {arXiv preprint arXiv:2305.03053},
year = {2024}
}