中文

算术Transformer的长度泛化

机器学习 2023-06-28 v1

摘要

我们考察Transformer如何应对两个挑战:学习基础整数算术,以及泛化到比训练时更长的序列。我们发现相对位置嵌入能够实现简单任务(如加法)的长度泛化:在55位数字上训练的模型可以执行1515位数字求和。然而,该方法在乘法上失效,我们提出训练集 priming( priming):向训练集中加入少量(10105050个)长序列。我们表明 priming 使得在55×\times 33位乘法上训练的模型能够泛化到35×335\times 3的样例。我们还表明模型可以被 priming 以针对不同泛化长度,且 priming 样本量随训练集大小的对数缩放。最后,我们讨论了 priming 在算术之外的潜在应用。

关键词

引用

@article{arxiv.2306.15400,
  title  = {Length Generalization in Arithmetic Transformers},
  author = {Samy Jelassi and Stéphane d'Ascoli and Carles Domingo-Enrich and Yuhuai Wu and Yuanzhi Li and François Charton},
  journal= {arXiv preprint arXiv:2306.15400},
  year   = {2023}
}