中文

任务特定提示对上下文学习的可证明益处

计算与语言 2025-03-06 v2 人工智能

摘要

现代语言模型的上下文学习能力激发了对序列模型更深层的数学理解。最近的一系列工作表明,线性注意力模型可以模拟投影梯度下降迭代,从而从上下文窗口提供的数据中隐式学习任务向量。在本工作中,我们考虑了一种新的设定,其中全局任务分布可以划分为条件任务分布的并集。然后,我们研究了使用单层注意力模型,通过任务特定提示和预测头来学习与条件任务分布相关的先验信息。我们关于损失景观的结果表明,任务特定提示促进了协方差-均值解耦,其中提示微调解释了分布的条件均值,而方差则是通过上下文学习学习/解释的。引入任务特定头通过完全解耦均值和方差分量的估计进一步促进了这一过程。这种协方差-均值视角同样解释了,在预训练后联合训练提示和注意力权重如何可证明地优于微调。

关键词

引用

@article{arxiv.2503.02102,
  title  = {Provable Benefits of Task-Specific Prompts for In-context Learning},
  author = {Xiangyu Chang and Yingcong Li and Muti Kara and Samet Oymak and Amit K. Roy-Chowdhury},
  journal= {arXiv preprint arXiv:2503.02102},
  year   = {2025}
}

备注

Proceedings of the 28th International Conference on Artificial Intelligence and Statistics (AISTATS) 2025