面向高效 Pareto 前沿逼近的专家混合模型融合方法
机器学习
2024-06-17 v1 人工智能
摘要
由于损失景观的复杂性以及训练和评估大型深度神经网络模型的计算成本高昂,解决大型深度神经网络的多目标优化问题是一个具有挑战性的任务。高效的Pareto前沿逼近为各种任务(如多任务学习和权衡分析)提供了多目标优化的可能性。现有的Pareto集学习算法,包括(1)进化、超网络和超体积最大化方法,计算成本高昂且对大型模型的可扩展性受限;(2)标量化算法,即为每个目标射线训练独立模型,对于学习整个Pareto集效率低且无法有效捕捉目标权衡。针对上述问题,本文受模型融合近期成功的启发,提出了一种基于专家混合(MoE)模型融合的实用且可扩展的Pareto集学习方法。通过对专用单任务模型权重的集成,MoE模块能够有效捕捉多个目标之间的权衡,并紧密逼近大型神经网络的整个Pareto集。一旦学习到路由器并设置偏好向量,MoE模块即可卸载,从而在推理期间不会引入额外的计算成本。我们在视觉和语言任务上使用大规模模型(如CLIP-ViT和GPT-2)进行了大量实验。实验结果表明,我们的方法有效地逼近了大型模型的整个Pareto前沿。仅使用数百个可训练参数的MoE路由器,本方法甚至比线性标量化和学习单个Pareto最优解的算法具有更低的内存占用,并且对目标数量和模型规模都具有可扩展性。
引用
@article{arxiv.2406.09770,
title = {Towards Efficient Pareto Set Approximation via Mixture of Experts Based Model Fusion},
author = {Anke Tang and Li Shen and Yong Luo and Shiwei Liu and Han Hu and Bo Du},
journal= {arXiv preprint arXiv:2406.09770},
year = {2024}
}
备注
code is available at https://github.com/tanganke/pareto_set_learning