Model Breadcrumbs:通过稀疏掩码扩展多任务模型合并
机器学习
2024-08-13 v2
摘要
AI系统的快速发展深受基础模型出现的影响。针对特定问题的常见方法是对这些预训练的基础模型进行微调以完成特定目标任务,导致针对各种任务微调的模型迅速扩散。本文聚焦于合并源自一系列辅助任务的同一基础模型的多次微调的问题。我们提出了一种新的简单方法——Model Breadcrumbs,它由一组稀疏定义的权重组成,在预训练模型的权重空间中引导模型适应。这些面包屑是通过在微调前后减去预训练模型的权重,然后进行稀疏化过程(消除权重异常值和微小扰动)来构建的。我们的实验证明了Model Breadcrumbs在同时提升多个任务性能方面的有效性。这一贡献与可更新机器学习的演变范式相一致,让人联想到开源软件开发背后的协作原则,促进了社区驱动的努力以可靠地更新机器学习模型。我们的方法被证明更高效,并且与之前的提议不同,它不需要为每个新添加的任务调整超参数。通过涉及各种模型、任务和模态的大量实验,我们确定集成Model Breadcrumbs为构建多任务模型和促进基础模型更新提供了一种简单、高效且非常有效的方法。
引用
@article{arxiv.2312.06795,
title = {Model Breadcrumbs: Scaling Multi-Task Model Merging with Sparse Masks},
author = {MohammadReza Davari and Eugene Belilovsky},
journal= {arXiv preprint arXiv:2312.06795},
year = {2024}
}
备注
Published in ECCV 2024