Transformer 与循环神经网络表征能力的分离
机器学习
2024-06-14 v1 机器学习
摘要
Transformer 架构已在基础模型中广泛采用。由于其高推理成本,人们重新关注高效循环神经网络(RNN)的潜力。本文分析了 Transformer 和 RNN 在多个实用任务(包括索引查找、最近邻、识别受限 Dyck 语言以及字符串相等)中的表征能力差异。对于所考察的任务,我们的结果显示基于模型所需规模的分离。例如,我们表明,一个单层的对数宽度 Transformer 可执行索引查找,而 RNN 需要线性规模的隐藏状态。相反,虽然常数大小的 RNN 可识别受限 Dyck 语言,但我们表明单层 Transformer 对此任务需要线性规模。此外,我们表明,两个层的对数规模 Transformer 可执行诸如字符串相等或不相交等决策任务,而单层 Transformer 和循环模型对这些任务都需要线性规模。我们还表明,一个对数规模的两层 Transformer 可在其前向传递中实现最近邻算法;另一方面,循环模型需要线性规模。我们的构造基于存在于 维空间中约正交的 个向量,下界基于从通信复杂性问题的归约得出。我们补充了实验结果,以突出这些架构在实际规模序列上的性能差异。
关键词
引用
@article{arxiv.2406.09347,
title = {Separations in the Representational Capabilities of Transformers and Recurrent Architectures},
author = {Satwik Bhattamishra and Michael Hahn and Phil Blunsom and Varun Kanade},
journal= {arXiv preprint arXiv:2406.09347},
year = {2024}
}
备注
Preprint