技能上下文提示:释放大语言模型的组合泛化能力
计算与语言
2024-07-18 v3
摘要
我们研究了如何激发大语言模型(LLMs)的组合泛化能力。组合泛化使 LLMs 能够通过组合基础技能来解决复杂问题,这是一种类似于人类智能的关键推理能力。然而,即便是最先进的 LLMs 目前仍难以应对此类推理。我们在上下文学习(in-context learning)的框架下考察该问题,发现于同一提示上下文中同时展示基于这些基础技能的基础技能与组合示例至关重要。我们将这种提示结构称为技能上下文(skills-in-context, SKiC)。仅需少量(少至两个)示例,这种上下文学习结构便能赋能 LLMs 处理需要创新性技能组合的更具挑战性的问题,在广泛任务上实现近乎完美的系统性泛化。有趣的是,SKiC 还释放了 LLMs 的潜在能力,使其能更主动地利用在早前预训练阶段获得的已有内部技能来解决复杂推理问题。SKiC 结构在不同技能构建与示例选择下均表现稳健,并对新任务展现出强迁移性。最后,受我们的上下文学习研究启发,我们表明使用 SKiC 风格数据微调 LLMs 可激发零样本弱到强泛化,使模型能够借助标准提示直接解决困难得多的问题。
引用
@article{arxiv.2308.00304,
title = {Skills-in-Context Prompting: Unlocking Compositionality in Large Language Models},
author = {Jiaao Chen and Xiaoman Pan and Dian Yu and Kaiqiang Song and Xiaoyang Wang and Dong Yu and Jianshu Chen},
journal= {arXiv preprint arXiv:2308.00304},
year = {2024}
}