Hub-Pathway:从预训练模型枢纽进行迁移学习
机器学习
2022-11-07 v2
摘要
迁移学习旨在利用预训练模型中的知识惠及目标任务。以往的迁移工作主要从单一模型迁移。然而,随着从不同资源预训练的深度模型的出现,由具有不同架构、预训练数据集和学习范式的多样模型构成的模型枢纽(model hub)已可用。直接将单模型迁移学习方法应用于每个模型会浪费模型枢纽的丰富知识并带来高计算成本。本文提出一种Hub-Pathway框架以实现从模型枢纽的知识迁移。该框架生成数据依赖的路径权重,基于此我们在输入层分配路径路由以决定激活并穿过哪些预训练模型,然后在输出层设置路径聚合以聚合来自不同模型的知识进行预测。所提框架可使用目标任务特定损失进行端到端训练,从而学习探索更优路径配置并利用预训练模型中针对每个目标数据的知识。我们利用带噪声的路径生成器并设计一种探索损失以进一步探索模型枢纽中的不同路径。为充分挖掘预训练模型中的知识,每个模型由其激活所对应的特定数据进一步训练,从而保证其性能并增强知识迁移。在计算机视觉与强化学习任务上的实验结果表明,所提Hub-Pathway框架在模型枢纽迁移学习中达到了最先进的性能。
引用
@article{arxiv.2206.03726,
title = {Hub-Pathway: Transfer Learning from A Hub of Pre-trained Models},
author = {Yang Shu and Zhangjie Cao and Ziyang Zhang and Jianmin Wang and Mingsheng Long},
journal= {arXiv preprint arXiv:2206.03726},
year = {2022}
}
备注
Accepted by NeurIPS 2022