多任务模型合并的表示手术
机器学习
2024-05-29 v2 人工智能
计算机视觉与模式识别
摘要
多任务学习将来自多个任务的信息压缩到一个统一的主干中,以提高计算效率和泛化能力。最近的工作直接合并多个独立训练的模型来执行多任务学习,而不是收集它们的原始数据进行联合训练,这极大地扩展了多任务学习的应用场景。然而,通过可视化现有模型合并方案的表示分布,我们发现合并后的模型常常遭受表示偏差的困境。也就是说,合并模型与单个模型之间的表示分布存在显著差异,导致合并后的多任务学习性能不佳。在本文中,我们提出了一种称为“Surgery”的表示手术解决方案,以减少合并模型中的表示偏差。具体来说,Surgery是一个轻量级的任务特定模块,它以合并模型的表示为输入,并尝试输出合并模型表示中包含的偏差。然后我们设计了一个无监督优化目标,通过最小化合并模型表示与单个模型表示之间的距离来更新Surgery模块。大量实验表明,当我们的Surgery模块应用于最先进的模型合并方案时,多任务学习性能显著提升。
引用
@article{arxiv.2402.02705,
title = {Representation Surgery for Multi-Task Model Merging},
author = {Enneng Yang and Li Shen and Zhenyi Wang and Guibing Guo and Xiaojun Chen and Xingwei Wang and Dacheng Tao},
journal= {arXiv preprint arXiv:2402.02705},
year = {2024}
}
备注
Forty-first International Conference on Machine Learning (ICML 2024)