算术Transformer的长度泛化
机器学习
2023-06-28 v1
摘要
我们考察Transformer如何应对两个挑战:学习基础整数算术,以及泛化到比训练时更长的序列。我们发现相对位置嵌入能够实现简单任务(如加法)的长度泛化:在位数字上训练的模型可以执行位数字求和。然而,该方法在乘法上失效,我们提出训练集 priming( priming):向训练集中加入少量(到个)长序列。我们表明 priming 使得在位 位乘法上训练的模型能够泛化到的样例。我们还表明模型可以被 priming 以针对不同泛化长度,且 priming 样本量随训练集大小的对数缩放。最后,我们讨论了 priming 在算术之外的潜在应用。
引用
@article{arxiv.2306.15400,
title = {Length Generalization in Arithmetic Transformers},
author = {Samy Jelassi and Stéphane d'Ascoli and Carles Domingo-Enrich and Yuhuai Wu and Yuanzhi Li and François Charton},
journal= {arXiv preprint arXiv:2306.15400},
year = {2023}
}