少量深度大作用:对数深度Transformer的表达能力
机器学习
2025-11-07 v3 计算复杂性
摘要
近期理论结果表明,Transformer无法对长输入表达序列推理问题,直观原因是其计算深度有界。然而,先前的研究将深度视为常数,因此尚不清楚有界深度在多程度上足以解决短输入问题,以及增加Transformer深度如何影响其表达能力。本文通过分析深度可随上下文长度最小化增长的Transformer来回答这些问题。我们证明,即使深度为的高度均匀Transformer也能表达两个重要问题:识别正则语言(捕捉状态追踪能力,此前已知只能由一种非传统的非均匀Transformer模型表达)和图连通性(支撑多步推理)。值得注意的是,在标准复杂度猜想下,这两个问题均无法由固定深度Transformer表达,从而展示了深度增长带来的表达力优势。此外,我们的理论定量预测了深度需随输入长度如何增长才能表达这些问题,表明深度扩展比扩展宽度或思维链步骤更高效。在经验层面,我们旨在弥合表达能力与可学习性之间差距的详细实验表明,正则语言识别所需的理论深度与成功训练Transformer所需的实际深度高度吻合。因此,我们的结果阐明了深度如何影响Transformer的推理能力,并为序列推理的有效深度选择提供了实践指导。
引用
@article{arxiv.2503.03961,
title = {A Little Depth Goes a Long Way: The Expressive Power of Log-Depth Transformers},
author = {William Merrill and Ashish Sabharwal},
journal= {arXiv preprint arXiv:2503.03961},
year = {2025}
}
备注
NeurIPS 2025