中文

MING-MOE: 通过稀疏混合低秩适配器专家增强大语言模型中的医学多任务学习

计算与语言 2024-04-16 v1

摘要

像ChatGPT这样的大语言模型在自然语言理解和生成方面取得了显著进展,在包括医学在内的各个学科中证明了其价值。尽管取得了进展,但由于医学任务固有的复杂性和多样性,通常需要多任务学习能力,因此仍然存在挑战。以前的方法虽然有益,但在实际应用中存在不足,因为它们需要在推理时进行任务特定的标注,限制了更广泛的泛化。本文介绍了MING-MOE,一种新颖的基于混合专家(MOE)的医学大语言模型,旨在管理多样且复杂的医学任务,无需任务特定的标注,从而增强了其在广泛数据集上的可用性。MING-MOE采用了混合低秩适配(MoLoRA)技术,通过保持基础模型参数静态,同时通过一组最小的可训练参数进行适配,实现了高效的参数使用。我们证明MING-MOE在超过20个医学任务上达到了最先进的性能,展示了相对于现有模型的显著改进。这种方法不仅扩展了医学语言模型的能力,还提高了推理效率。

关键词

引用

@article{arxiv.2404.09027,
  title  = {MING-MOE: Enhancing Medical Multi-Task Learning in Large Language Models with Sparse Mixture of Low-Rank Adapter Experts},
  author = {Yusheng Liao and Shuyang Jiang and Yu Wang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2404.09027},
  year   = {2024}
}

备注

15 pages, 3 figures