中文

Mixture-of-Instructions:通过混合提示对大语言模型进行对齐

计算与语言 2025-02-06 v2

摘要

随着大语言模型 (LLM) 的不断涌现,对此类模型在多个任务上的综合对齐已成为 critical 研究领域。现有的对齐方法主要针对单一任务,如多轮对话、编码、数学问题解决和工具使用。虽然这些任务已有大量高质量数据,但大多数数据仅提供问题和答案,未包含系统提示。经过对 Qwen 语言模型的详细分析,我们发现系统提示在 LLM 的训练和推理过程中具有显著影响。我们将这一现象归因于对系统提示的过拟合。在解决此问题的同时,我们引入一种新颖技术,称为 Mixture-of-Instructions (MoI),该技术采用指令打包结合多样化系统提示策略,以提升语言模型的对齐效率。我们还编译了七套多样化基准数据集,以严格评估 MoI 增强语言模型的对齐效能。我们的方法被应用于开源 Qwen-7B-chat 模型,最终发展出 Qwen-SFT-MoI。该增强模型在编码、数学和工具使用任务方面展现出显著的生成能力提升。

关键词

引用

@article{arxiv.2404.18410,
  title  = {Mixture-of-Instructions: Aligning Large Language Models via Mixture Prompting},
  author = {Bowen Xu and Shaoyu Wu and Kai Liu and Lulu Hu},
  journal= {arXiv preprint arXiv:2404.18410},
  year   = {2025}
}