通过混合语境微调提升大语言模型的复杂指令遵循能力
计算与语言
2025-05-20 v1
摘要
大型语言模型(LLMs)在处理自然语言任务方面表现突出;然而,它们可能难以持续遵循复杂指令,尤其是涉及多重约束的指令。在解决复杂指令遵循问题时,现有工作主要聚焦于数据驱动方法,通过合成复杂指令-输出对来进行监督微调(SFT)。然而,对关键子语境的注意力不足可能削弱SFT的效果。本文提出将顺序结构的输入指令转换为包含子语境的多个平行指令,以支持这种多输入处理。为此,我们提出MISO(Multi-Input Single-Output,即多输入单输出),是当前主流基于解码器-only Transformer架构的LLMs的一个扩展。MISO引入一种混合语境范式,同时考虑整体指令-输出对齐以及各子语境的影响,以增强SFT的效果。我们将MISO微调应用于复杂指令遵循数据集,并通过标准LLM推理进行评估。实证结果表明,MISO作为LLM的微调方法,在复杂指令遵循场景下的效果优越,并且在训练效率方面也具有潜在优势。
引用
@article{arxiv.2505.11922,
title = {Enhancing Complex Instruction Following for Large Language Models with Mixture-of-Contexts Fine-tuning},
author = {Yuheng Lu and ZiMeng Bai and Caixia Yuan and Huixing Jiang and Xiaojie Wang},
journal= {arXiv preprint arXiv:2505.11922},
year = {2025}
}