中文

低秩专家适配器集成

计算与语言 2025-02-04 v1 人工智能 机器学习

摘要

大型语言模型(LLMs)的训练与微调常涉及来自多个来源的多样化文本数据,这因梯度方向冲突而带来挑战,阻碍了优化和专业化。这些挑战可能损害模型在不同任务间的泛化能力,导致下游性能下降。近期研究表明,在精心挑选的、任务特定的数据子集上微调LLMs,其性能可以匹敌甚至超越使用整个数据集。基于这些见解,我们提出了低秩专家适配器集成(ELREA)框架,以提升模型处理多样化任务的能力。ELREA 根据训练指令的梯度方向对其进行聚类,这些方向代表了不同的专业领域,从而减少了优化过程中的冲突。然后,在这些聚类上训练专家适配器,利用低秩适应(LoRA)技术确保训练效率和模型可扩展性。在推理过程中,ELREA 根据输入数据与训练聚类的梯度相似度,组合来自最相关专家适配器的预测,确保为每个任务选择最优适配器。实验表明,在一系列领域特定任务中,我们的方法在训练和推理复杂度相似的情况下,性能优于在全数据集上训练的基线 LoRA 适配器及其他集成方法。

关键词

引用

@article{arxiv.2502.00089,
  title  = {Ensembles of Low-Rank Expert Adapters},
  author = {Yinghao Li and Vianne Gao and Chao Zhang and MohamadAli Torkamani},
  journal= {arXiv preprint arXiv:2502.00089},
  year   = {2025}
}

备注

29 pages, 5 figures, 5 tables; proceedings in ICLR 2025