中文

探索用于上下文学习的示例集成方法

计算与语言 2023-08-22 v2 人工智能

摘要

上下文学习(ICL)通过向语言模型(LMs)展示给定任务的输入-输出对示例(即演示)来运作。ICL 的标准方法是用拼接的演示加上测试输入来提示 LM。这种方法存在一些缺陷。首先,拼接几乎无法控制每个演示对模型预测的贡献,当某些演示与测试样本无关时,这可能是次优的。其次,由于某些 transformer 模型的输入长度限制,可能难以将许多示例放入上下文中,尤其是在处理长输入任务时。在本工作中,我们探索演示集成(DENSE)作为简单拼接的替代方案。DENSE 使用演示的子集(即桶)预测输出,然后合并各子集产生的输出概率以得到最终预测。我们使用 GPT-j 研究了不同的集成方法,并在 12 个语言任务上进行了实验。我们的实验表明,加权最大集成相比原始拼接平均高出多达 2.4 个点。代码见 https://github.com/mukhal/icl-ensembling。

关键词

引用

@article{arxiv.2308.08780,
  title  = {Exploring Demonstration Ensembling for In-context Learning},
  author = {Muhammad Khalifa and Lajanugen Logeswaran and Moontae Lee and Honglak Lee and Lu Wang},
  journal= {arXiv preprint arXiv:2308.08780},
  year   = {2023}
}

备注

Published at ME-FoMo workshop at ICLR 2023. Arxiv version includes evaluation on 5 more tasks