上下文学习是否足以让大语言模型遵循指令?
摘要
上下文学习(ICL)允许大语言模型在不改变其权重的情况下从示例中学习:这对于能够从大量示例中学习的超长上下文大语言模型来说是一项特别有前景的能力。最近,Lin等人(2024)提出了URIAL,一种仅使用三个上下文示例来对齐基础大语言模型的方法,取得了非平凡的指令遵循性能。在这项工作中,我们表明,尽管有效,但使用URIAL的ICL对齐在既定基准MT-Bench上的表现仍然不如指令微调,尤其是在使用能力更强的基础大语言模型时。然后,我们揭示了成功进行上下文对齐的最相关要素,发现了解码参数的关键作用。基于这些见解,我们表明,通过添加上下文中的高质量演示(可能通过贪婪搜索精心挑选),URIAL方法确实可以得到改进,从而更接近指令模型的性能。最后,据我们所知,我们首次在低数据量情况下对指令遵循任务中的ICL和指令微调(IFT)进行了系统比较,其中ICL可以作为IFT的可行替代方案。总的来说,我们的工作增进了对ICL作为一种对齐技术及其与IFT关系的理解。我们在https://github.com/tml-epfl/icl-alignment提供我们的代码。
引用
@article{arxiv.2405.19874,
title = {Is In-Context Learning Sufficient for Instruction Following in LLMs?},
author = {Hao Zhao and Maksym Andriushchenko and Francesco Croce and Nicolas Flammarion},
journal= {arXiv preprint arXiv:2405.19874},
year = {2025}
}
备注
Accepted at ICLR 2025. This camera-ready version v3 adds multi-turn alignment via ICL, revisiting main results on instruct models, and simple mechanistic study. Updates in the v2: experiment with decoding schemes, scaling in-context alignment, ICL vs IFT for instruction following. Code at https://github.com/tml-epfl/icl-alignment