中文

AdaMoLE:基于自适应混合低秩适应专家进行大语言模型的精调

计算与语言 2024-08-13 v2

摘要

我们介绍 AdaMoLE,一种用于微调大型语言模型 (LLM) 的新方法,即自适应混合低秩适应 (LoRA) 专家。我们超越传统方法,后者采用固定 top-k 策略激活专家。AdaMoLE 通过专门的阈值网络动态调整激活阈值,以适应不同任务的复杂性。通过将一个层中的单个 LoRA 替换为多个 LoRA 专家并集成带有阈值机制的门控函数,AdaMoLE 有效地根据输入上下文选择和激活最合适的专家。我们在各种常识推理和自然语言处理任务上进行了广泛评估,表明 AdaMoLE 超越了基准性能。这一提升凸显了 AdaMoLE 自适应选择 LoRA 专家的优势,在不增加专家数量的前提下提高了模型效果。实验验证不仅确认 AdaMoLE 是增强 LLM 稳健方法,也为在自适应专家选择机制方面探索未来研究方向提供了建议,potentially 拓宽了在 diverse 语言处理任务中优化模型性能的范围。

关键词

引用

@article{arxiv.2405.00361,
  title  = {AdaMoLE: Fine-Tuning Large Language Models with Adaptive Mixture of Low-Rank Adaptation Experts},
  author = {Zefang Liu and Jiahua Luo},
  journal= {arXiv preprint arXiv:2405.00361},
  year   = {2024}
}