中文

暂停 Token 严格增强常数深度 Transformer 的表达能力

机器学习 2025-05-28 v1 计算与语言

摘要

暂停 token(如“...”等简单填充符号)在语言和数学任务上持续提升了 Transformer 的性能,但其理论效应仍未得到解释。我们提供了首个形式化分离结果,证明向常数深度、对数宽度的 Transformer 添加暂停 token 会严格增强其计算表达能力。在有限精度激活下,没有暂停 token 的 Transformer 仅能计算 AC0\mathsf{AC}^0 函数的一个严格子集,而添加多项式数量的暂停 token 使其能够表达整个函数类。对于对数精度的 Transformer,我们证明添加暂停 token 可实现等价于 TC0\mathsf{TC}^0 的表达能力,与已知的上界相匹配。在实验上,我们证明两层因果掩码 Transformer 在提供暂停 token 时可以学习奇偶性,而如果没有暂停 token,它们似乎无法学习该函数。我们的结果为先前的实验发现提供了严格的理论解释,阐明了暂停 token 如何与宽度、深度和数值精度相互作用,并将其定位为一种独特的、与思维链提示互补的机制,以增强 Transformer 的推理能力。

关键词

引用

@article{arxiv.2505.21024,
  title  = {Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers},
  author = {Charles London and Varun Kanade},
  journal= {arXiv preprint arXiv:2505.21024},
  year   = {2025}
}