变压器的拓扑问题
机器学习
2026-04-29 v2 人工智能
摘要
变压器通过扩大的上下文历史对序列进行结构编码。然而,其纯 feedforward 架构根本限制了动态状态跟踪。状态跟踪——即反映不断变化环境的潜在变量的迭代更新——涉及本质上是顺序依赖的过程,而 feedforward 网络难以维持这种依赖。因此,feedforward 模型会将不断深入的状态表示推向其层堆栈,以每个新输入步骤为单位,导致信息在浅层不可访问,最终耗尽模型的深度。尽管可以通过 dynamic depth 模型和显式或潜在的思维外部化状态表示来绕过这一限制,但这些解决方案在计算和内存效率方面较差。本文我们主张,时延性扩展的认知需要将注意力从显式思维痕迹转向隐式激活动态,以递归架构为中心。我们引入一种递归和连续思维变压器架构的分类法,依据其递归轴(深度 vs 步骤)及其输入标记数与递归步骤数之比进行分类。最后,我们概述了一些有前景的研究方向,包括增强的状态空间模型和粗粒度递归,以更好地集成现代基础模型中的状态跟踪。
关键词
引用
@article{arxiv.2604.17121,
title = {The Topological Trouble With Transformers},
author = {Michael C. Mozer and Shoaib Ahmed Siddiqui and Rosanne Liu},
journal= {arXiv preprint arXiv:2604.17121},
year = {2026}
}