基于简单算术任务探究 Transformer 的局限性
计算与语言
2021-04-14 v3 人工智能
机器学习
摘要
执行算术任务的能力是人类智能的一项显著特质,并可能构成更复杂推理任务的关键组成部分。在这项工作中,我们研究了数字的表层形式是否对序列到序列语言模型在广泛数值范围内学习加法和减法等简单算术任务产生影响。我们发现,数字的表层表示形式对模型的准确率有强烈影响。具体而言,当使用子词(如“32”)时,模型无法学习五位数的加法;而在字符级表示(如“3 2”)下学习也颇为困难。通过引入位置令牌(如“3 10e1 2”),模型学会了精确地对多达 60 位的数字进行加减运算。我们得出结论:只要使用恰当的表层表示,现代预训练语言模型能从极少量样本中轻松学习算术。这一结果进一步证明,子词分词器与位置编码是当前 Transformer 设计中可能需要改进的组件。此外,我们表明无论参数数量和训练样本多少,模型都无法学习与训练中所见数字长度无关的加法规则。用于复现我们实验的代码可在 https://github.com/castorini/transformers-arithmetic 获取。
引用
@article{arxiv.2102.13019,
title = {Investigating the Limitations of Transformers with Simple Arithmetic Tasks},
author = {Rodrigo Nogueira and Zhiying Jiang and Jimmy Lin},
journal= {arXiv preprint arXiv:2102.13019},
year = {2021}
}