中文

Transformer 通用推理的障碍(及其克服方法)

机器学习 2026-04-29 v1 计算与语言

摘要

经验上已表明思维链 能够提升 Transformer 的性能,并在理论上将其表达能力提升至图灵完备。然而,Transformer 能否学会泛化到比训练时所见更长的 CoT 轨迹,仍缺乏充分研究。我们使用近期的 Transformer 长度泛化理论框架发现——在标准位置编码与有限字母表下——带有 CoT 的 Transformer 无法解决超出 TC0TC^0 的问题,即其表达能力优势在长度可泛化可学习性这一更严格要求下并不成立。但是,如果我们允许词汇表随问题规模增长,便能得到图灵机的长度可泛化模拟,其中 CoT 轨迹长度与模拟运行时间呈线性关系(至多相差一个常数)。我们的构造克服了可靠长度泛化的两个核心障碍:重复复制与最后出现检索。我们为每个磁带位置分配唯一的路标词元,并仅记录值的变化,从而通过计数恢复当前磁带符号,绕过了这两个障碍。此外,我们通过实验表明,使用此类路标词元和值变化编码为在困难问题上改进长度泛化提供了可操作的指导。

关键词

引用

@article{arxiv.2604.25800,
  title  = {Barriers to Universal Reasoning With Transformers (And How to Overcome Them)},
  author = {Oliver Kraus and Yash Sarrof and Yuekun Yao and Alexander Koller and Michael Hahn},
  journal= {arXiv preprint arXiv:2604.25800},
  year   = {2026}
}

备注

Oliver Kraus and Yash Sarrof contributed equally as first authors. Alexander Koller and Michael Hahn are co-senior authors. Code: https://github.com/coli-saar/BarriersToUniversalReasoningWTransformers