探索用于上下文学习的示例集成方法
计算与语言
2023-08-22 v2 人工智能
摘要
上下文学习(ICL)通过向语言模型(LMs)展示给定任务的输入-输出对示例(即演示)来运作。ICL 的标准方法是用拼接的演示加上测试输入来提示 LM。这种方法存在一些缺陷。首先,拼接几乎无法控制每个演示对模型预测的贡献,当某些演示与测试样本无关时,这可能是次优的。其次,由于某些 transformer 模型的输入长度限制,可能难以将许多示例放入上下文中,尤其是在处理长输入任务时。在本工作中,我们探索演示集成(DENSE)作为简单拼接的替代方案。DENSE 使用演示的子集(即桶)预测输出,然后合并各子集产生的输出概率以得到最终预测。我们使用 GPT-j 研究了不同的集成方法,并在 12 个语言任务上进行了实验。我们的实验表明,加权最大集成相比原始拼接平均高出多达 2.4 个点。代码见 https://github.com/mukhal/icl-ensembling。
引用
@article{arxiv.2308.08780,
title = {Exploring Demonstration Ensembling for In-context Learning},
author = {Muhammad Khalifa and Lajanugen Logeswaran and Moontae Lee and Honglak Lee and Lu Wang},
journal= {arXiv preprint arXiv:2308.08780},
year = {2023}
}
备注
Published at ME-FoMo workshop at ICLR 2023. Arxiv version includes evaluation on 5 more tasks