少样本微调与上下文学习:一项公平的比较与评估
计算与语言
2023-05-31 v2
摘要
少样本微调与上下文学习是预训练语言模型任务自适应的两种替代策略。近来,上下文学习因其简洁性、改进的分布外泛化能力,以及大量证据表明微调模型会习得虚假相关性,而比微调更受欢迎。遗憾的是,以往对这两种方法的比较使用了不同规模的模型。这引发了疑问:所观察到的微调模型较弱的分布外泛化究竟是微调的固有属性,还是实验设置的局限。在本文中,我们在控制所用模型、示例数量及参数量(从 125M 到 30B)的前提下,比较少样本微调与上下文学习在挑战性数据集上的泛化能力。我们的结果表明,微调语言模型实际上可以很好地泛化到分布外。我们发现两种方法泛化表现相似;它们表现出较大差异,并依赖于模型规模和示例数量等属性,凸显出鲁棒的任务自适应仍是一项挑战。
引用
@article{arxiv.2305.16938,
title = {Few-shot Fine-tuning vs. In-context Learning: A Fair Comparison and Evaluation},
author = {Marius Mosbach and Tiago Pimentel and Shauli Ravfogel and Dietrich Klakow and Yanai Elazar},
journal= {arXiv preprint arXiv:2305.16938},
year = {2023}
}
备注
Accepted to Findings of ACL 2023