探索大语言模型的长度泛化能力
计算与语言
2022-11-15 v2 机器学习
摘要
从短问题实例外推到更长实例的能力是推理任务中一种重要的分布外泛化形式,并且在从较长问题实例稀有的数据集中学习时至关重要。这些包括定理证明、定量数学问题求解以及小说阅读/摘要。本文中,我们进行了细致的实证研究,探索基于transformer的语言模型的长度泛化能力。我们首先确定,在长度泛化任务上朴素微调transformer显示出与模型规模无关显著的泛化缺陷。然后我们展示,将预训练大语言模型(LLM)的上下文学习能力与scratchpad提示(要求模型在给出答案前输出求解步骤)相结合,可带来长度泛化的显著提升。我们对每种学习模态进行了细致的失败分析,并识别出常见错误来源,这些来源凸显了赋予语言模型泛化到更长问题能力的机遇。
引用
@article{arxiv.2207.04901,
title = {Exploring Length Generalization in Large Language Models},
author = {Cem Anil and Yuhuai Wu and Anders Andreassen and Aitor Lewkowycz and Vedant Misra and Vinay Ramasesh and Ambrose Slone and Guy Gur-Ari and Ethan Dyer and Behnam Neyshabur},
journal= {arXiv preprint arXiv:2207.04901},
year = {2022}
}