具备(摘要式)思维链的低精度 Softmax Transformer 的表达能力
机器学习
2026-05-19 v1 计算复杂性
计算与语言
摘要
现有关于 Transformer 表达能力的结果通常依赖于 hardmax 注意力、高精度以及其他使它们脱离实际所用模型的架构修改。我们通过分析具有 softmax 注意力且对激活值与注意力权重进行舍入的标准 Transformer 解码器来弥合这一差距,同时允许深度与宽度随上下文长度对数增长。作为中间步骤,我们构建了具有三值激活值与良好分离的注意力分数的 hardmax Transformer,利用思维链 (CoT) 模拟 Turing 机。这使我们能够将上述构造转换为等效的 softmax Transformer,而无需先前方法所需的不切实际的参数幅度或激活精度。使用相同技术,我们分析了一种近期提出的摘要式 CoT 范式,并表明它能更高效地模拟 Turing 机,其模型大小随空间界限而非时间界限对数缩放。我们在 Sudoku 推理任务上实证检验了结果所作的预测,发现相较于先前的高精度结果,其与可学习性的吻合度更好。我们的代码可在 https://github.com/moritzbroe/transformer-expressivity 获取。
引用
@article{arxiv.2605.18079,
title = {The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought},
author = {Moritz Brösamle and Stephan Eckstein},
journal= {arXiv preprint arXiv:2605.18079},
year = {2026}
}
备注
Accepted to ICML 2026