演示、链条思维与提示:ICL的理论分析
机器学习
2026-03-23 v1
摘要
类比学习(ICL)通过对小型输入输出演示进行条件化,使预训练大语言模型能够适应下游任务,无需进行参数更新。尽管已有许多理论努力解释ICL的工作原理,但大多数要么依赖强大的架构或数据假设,要么未能捕捉演示选择、链条思维(CoT)提示、演示数量以及提示模板等关键实践因素的影响。我们通过在轻微假设下建立ICL的理论分析,链接这些设计选择与泛化行为。我们推导了ICL测试损失的上界,表明性能受制于(i)所选演示的质量,通过沿着连接测试提示与预训练样本的路径上ICL损失的Lipschitz常数来量化,(ii)预训练模型的内在ICL能力,以及(iii)分布迁移的程度。在同一框架中,我们将CoT提示分析为引发任务分解,表明当演示在每个子步骤上被良好选择且 resulting subtasks 易于学习时,CoT是有益的。最后,我们刻画了ICL性能对提示模板的敏感性如何随演示数量的变化而变化。总之,本研究表明,预训练为模型提供了超越观察任务的泛化能力,而CoT使模型能够将更简单的子任务组合成更复杂的子任务,演示和指令使其能够检索相似或更复杂的任务,包括可组合成更复杂子任务的任务,从而共同支持对未见任务的泛化。所有理论见解均得到实验的 corroboration。
引用
@article{arxiv.2603.19611,
title = {Demonstrations, CoT, and Prompting: A Theoretical Analysis of ICL},
author = {Xuhan Tong and Yuchen Zeng and Jiawei Zhang},
journal= {arXiv preprint arXiv:2603.19611},
year = {2026}
}