利用开放知识推动大语言模型任务专长
计算机视觉与模式识别
2024-09-10 v2 人工智能
计算与语言
摘要
培养大语言模型(LLM)以解决特定领域任务的专长能力,往往需要针对预期稳定输出进行特殊化调校。为避免大量人工准备指令数据集和数百小时的训练资源成本,开发者们利用开放知识(包括大量低秩适配(LoRA)模型和指令数据集)作为良好起点。然而,现有方法在模型与数据选择上关注通用能力,忽略了在特定领域部署中暴露的知识差距。本研究提出通过引入少量人工标注样本(即K-shot)来弥合这一差距,从而提升LLM在特定任务上的专长。具体而言,我们开发了一种高效且可扩展的管道,以成本效益的方式生产任务专家,其中K-shot数据介入于筛选最有希望的专家候选者及任务相关指令。我们构建了一种混合专家(MoE)系统,以充分利用多个专家各自独特且互补的知识。我们揭示了MoE系统成功的两个关键因素:1)遵循K-shot原则;2)坚持多样性。对于前者,我们确保所选模型在K-shot任务上具备真正的解题能力,而非盲目猜测。此外,在数据选择过程中,我们优先选择与K-shot任务相关的上下文。对于后者,我们强调在模型与数据选择过程中所包含专家的多样性以及精调指令的多样性。大量实验结果表明,我们的方法在利用开放知识方面优于现有方法,适用于各种任务。我们的代码将在https://github.com/Yaphabates/Rocket上发布。
引用
@article{arxiv.2408.15915,
title = {Leveraging Open Knowledge for Advancing Task Expertise in Large Language Models},
author = {Yuncheng Yang and Yulei Qin and Tong Wu and Zihan Xu and Gang Li and Pengcheng Guo and Hang Shao and Yuchen Shi and Ke Li and Xing Sun and Jie Yang and Yun Gu},
journal= {arXiv preprint arXiv:2408.15915},
year = {2024}
}
备注
29 pages, 12 tables, 10 figures