中文

特征自适应与数据可扩展的上下文学习

计算与语言 2024-06-04 v2

摘要

在上下文学习(ICL)中,通过多个示例进行推理已成为激发大语言模型在下游任务中能力的广泛范式。由于上下文长度限制,尽管增加训练数据,ICL 仍无法进一步提升,而且从大语言模型中直接获得的通用特征对特定下游任务并不自适应。本文提出了一种特征自适应和数据可扩展的上下文学习框架(FADS-ICL),可利用针对下游任务的任务自适应特征来促进下游任务上的推理,同时利用超出上下文的样本进行监督。具体而言,它首先通过大语言模型以 ICL 输入形式逐个提取超出上下文样本的通用特征,然后引入任务特定的调制器,对进行特征细化和预测。我们在 FADS-ICL 下进行了大量实验,涵盖 varying data settings(4\sim128 shots)和 LLM scale(0.8\sim70B)设置。实验结果显示,FADS-ICL 在所有设置下均显著优于以前的状态方法,验证了 FADS-ICL 的有效性和优越性。例如,在 1.5B 参数且 32 shots 设置下,FADS-ICL 在 10 个数据集上的平均准确率比 vanilla ICL 提高 \textbf{+14.3},比之前的状态方法提高 \textbf{+6.2},并且随着训练数据的增加,性能还能进一步提升。代码和数据已公开于 https://github.com/jiahaozhenbang/FADS-ICL。

关键词

引用

@article{arxiv.2405.10738,
  title  = {Feature-Adaptive and Data-Scalable In-Context Learning},
  author = {Jiahao Li and Quan Wang and Licheng Zhang and Guoqing Jin and Zhendong Mao},
  journal= {arXiv preprint arXiv:2405.10738},
  year   = {2024}
}

备注

Accepted at ACL 2024 main conference