中文

高效可拼接任务适配

机器学习 2024-07-10 v2 计算与语言 计算机视觉与模式识别

摘要

预训练与微调范式已为深度学习模型部署奠定基础。然而,多数微调方法旨在满足特定资源预算。近来,考虑到具有不同资源预算的多样部署场景,SN-Net被引入,通过模型拼接从模型族中的预训练模型(锚点)快速获得众多新网络(拼接体)。尽管前景可期,SN-Net在适配新目标域时面临新挑战,包括巨大的内存与存储需求,以及漫长且次优的多阶段适配过程。本工作中,我们提出一种新颖框架——高效可拼接任务适配(ESTA),以高效生成符合多样资源约束的微调模型集。具体而言,我们首先定制参数高效微调,在拼接体间共享低秩更新同时保持独立的偏置项。由此,我们大幅降低微调内存负担并缓解任务适配中拼接体间的干扰。此外,我们精简了一个简单而有效的一阶段部署流程,利用训练时梯度统计估计待部署的重要拼接体。通过为重要拼接体分配更高采样概率,我们还获得了提升的帕累托前沿。在25个下游视觉识别任务上的大量实验表明,我们的ESTA能够生成具有平滑准确率-效率权衡的拼接体,并以显著更短训练时间与更少可训练参数大幅超越直接SN-Net适配。进一步,我们通过拼接来自LLaMA族的LLMs展示了ESTA框架的灵活性与可扩展性,获得了多种规模的聊天机器人拼接体。源代码见 https://github.com/ziplab/Stitched_LLaMA

关键词

引用

@article{arxiv.2311.17352,
  title  = {Efficient Stitchable Task Adaptation},
  author = {Haoyu He and Zizheng Pan and Jing Liu and Jianfei Cai and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2311.17352},
  year   = {2024}
}

备注

CVPR 2024 camera ready