论上下文学习中的组合泛化差距
计算与语言
2022-11-17 v1 机器学习
摘要
预训练的大型生成式语言模型在许多任务上表现出色,但展现出较低的组合泛化能力。已有研究表明,扩展此类模型的规模可改善其在各类 NLP 任务上的表现,即便仅以少量示例为条件使其无需任何微调即可解决任务(即上下文学习)。本工作中,我们考察此类模型在语义解析任务中采用上下文学习时分布内(ID)与分布外(OOD)表现之间的差距。在 ID 设定下,演示示例来自模型所评估的同一划分(测试或训练),而在 OOD 设定下则来自另一划分。我们考察随着模型规模扩大,上下文学习的相对泛化差距如何演变。我们在三个语义解析数据集 CFQ、SCAN 和 GeoQuery 上评估了 OPT、BLOOM、CodeGen 和 Codex 四个模型族,使用不同数量的示例,并观察到随着模型规模扩大相对泛化差距减小的趋势。
引用
@article{arxiv.2211.08473,
title = {On the Compositional Generalization Gap of In-Context Learning},
author = {Arian Hosseini and Ankit Vani and Dzmitry Bahdanau and Alessandro Sordoni and Aaron Courville},
journal= {arXiv preprint arXiv:2211.08473},
year = {2022}
}