中文

论上下文学习中的组合泛化差距

计算与语言 2022-11-17 v1 机器学习

摘要

预训练的大型生成式语言模型在许多任务上表现出色,但展现出较低的组合泛化能力。已有研究表明,扩展此类模型的规模可改善其在各类 NLP 任务上的表现,即便仅以少量示例为条件使其无需任何微调即可解决任务(即上下文学习)。本工作中,我们考察此类模型在语义解析任务中采用上下文学习时分布内(ID)与分布外(OOD)表现之间的差距。在 ID 设定下,演示示例来自模型所评估的同一划分(测试或训练),而在 OOD 设定下则来自另一划分。我们考察随着模型规模扩大,上下文学习的相对泛化差距如何演变。我们在三个语义解析数据集 CFQ、SCAN 和 GeoQuery 上评估了 OPT、BLOOM、CodeGen 和 Codex 四个模型族,使用不同数量的示例,并观察到随着模型规模扩大相对泛化差距减小的趋势。

关键词

引用

@article{arxiv.2211.08473,
  title  = {On the Compositional Generalization Gap of In-Context Learning},
  author = {Arian Hosseini and Ankit Vani and Dzmitry Bahdanau and Alessandro Sordoni and Aaron Courville},
  journal= {arXiv preprint arXiv:2211.08473},
  year   = {2022}
}