中文

注意力在提示微调中的作用

机器学习 2023-06-07 v1 计算与语言 机器学习

摘要

提示微调(prompt-tuning)是一种新兴策略,通过从数据中学习(软)提示参数使大语言模型(LLM)适应下游任务。尽管在LLM中取得成功,人们对提示微调的能力以及注意力机制在提示中的作用仍缺乏理论理解。本文针对单层注意力架构探索提示微调,并研究上下文混合模型,其中每个输入词元属于上下文相关或无关集合。我们通过一个自包含的提示-注意力模型分离出提示微调的作用。我们的贡献如下:(1) 表明在我们的上下文数据模型下,softmax-提示-注意力在表达能力上可证明强于softmax-自注意力和线性-提示-注意力。(2) 我们分析梯度下降的初始轨迹,表明其以近最优样本复杂度学习提示与预测头,并展示提示如何可证明地关注稀疏上下文相关词元。(3) 假设已知提示但预测头未知,我们刻画了提示-注意力的精确有限样本性能,揭示了基本性能极限与上下文信息的确切益处。我们还提供了在真实数据集上验证理论见解的实验,并展示提示微调如何使模型关注上下文相关信息。

关键词

引用

@article{arxiv.2306.03435,
  title  = {On the Role of Attention in Prompt-tuning},
  author = {Samet Oymak and Ankit Singh Rawat and Mahdi Soltanolkotabi and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2306.03435},
  year   = {2023}
}

备注

Published at ICML 2023