Transformer 中的简洁性偏置及其学习稀疏布尔函数的能力
机器学习
2023-07-11 v2 计算与语言
摘要
尽管 Transformer 在 NLP 任务上取得了广泛成功,最近的研究发现,与循环模型相比,它们难以对若干形式语言建模。这引发了一个问题:为何 Transformer 在实践中表现良好,以及它们是否具有任何使其比循环模型更好泛化的特性。在这项工作中,我们对布尔函数进行了广泛的实证研究以证明如下几点:(i)随机 Transformer 相对更偏向于低敏感度的函数。(ii)当在布尔函数上训练时,Transformer 和 LSTM 都优先学习低敏感度的函数,其中 Transformer 最终收敛到更低敏感度的函数。(iii)在具有低敏感度的稀疏布尔函数上,我们发现 Transformer 即使在有噪声标签的情况下也近乎完美地泛化,而 LSTM 过拟合并达到较差的泛化准确率。总体而言,我们的结果提供了强有力的可量化证据,表明 Transformer 与循环模型的归纳偏置存在差异,这可能有助于解释 Transformer 在相对有限表达力下有效的泛化性能。
引用
@article{arxiv.2211.12316,
title = {Simplicity Bias in Transformers and their Ability to Learn Sparse Boolean Functions},
author = {Satwik Bhattamishra and Arkil Patel and Varun Kanade and Phil Blunsom},
journal= {arXiv preprint arXiv:2211.12316},
year = {2023}
}
备注
ACL 2023