预训练词频对少样本推理的影响
计算与语言
2023-03-17 v2 机器学习
摘要
预训练语言模型(LMs)已展示出通过少样本设置中少量示例外推执行数值推理的能力。然而,这种外推在多大程度上依赖于鲁棒推理尚不清楚。本文中,我们研究这些模型对预训练数据中较少频繁出现的项推理得有多好。特别地,我们检验模型在测试实例上的性能与该实例中项在预训练数据中的频率之间的相关性。我们针对若干基于GPT的语言模型(在Pile数据集上预训练)在多种数值演绎任务(例如算术与单位换算)上度量该相关性的强度。我们的结果一致表明,模型对出现更频繁项的实例更准确,在某些情况下,相较于底部10%频繁项,顶部10%频繁项的准确率高出(绝对)以上。总体而言,尽管LMs在少样本数值推理任务上表现出强性能,我们的结果提出了模型实际在多大程度上泛化到预训练数据之外的问题,并鼓励研究者在解释评估结果时将预训练数据考虑在内。
引用
@article{arxiv.2202.07206,
title = {Impact of Pretraining Term Frequencies on Few-Shot Reasoning},
author = {Yasaman Razeghi and Robert L. Logan and Matt Gardner and Sameer Singh},
journal= {arXiv preprint arXiv:2202.07206},
year = {2023}
}